Evals for Every Language - Language rn: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.86
2Claude Sonnet 4.664.19
3Claude Opus 4.864.01
4GPT-5.363.52
5GPT-5.561.71
6GPT-5.261.54
7Claude Opus 4.761.46
8Gemini 2.5 Pro60.56
9Grok 4.2060.34
10Claude Sonnet 4.559.98
11GPT-5.459.8
12GPT-559.03
13Gemini 3.1 Flash Lite58.87
14Qwen 3.6 Plus57.92
15GPT-5.157.25

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-rn · How It Works · Data refreshed daily, snapshot 2026-09-05.