Evals for Every Language - Language rn — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.86
2Claude Sonnet 4.664.19
3Claude Opus 4.864.01
4GPT-5.561.71
5GPT-5.261.54
6Claude Opus 4.761.46
7Gemini 2.5 Pro60.56
8Grok 4.2060.34
9Claude Sonnet 4.559.98
10GPT-5.459.8
11GPT-559.03
12Gemini 3.1 Flash Lite58.87
13Qwen 3.6 Plus57.92
14GPT-5.157.25
15Claude Sonnet 454.24

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-rn · How the rankings work · Data refreshed daily, snapshot 2026-07-22.