Evals for Every Language - Language nn — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.37
2Gemini 3.1 Flash Lite62.33
3Claude Opus 4.761.83
4Gemini 2.5 Flash Lite61.69
5Claude Sonnet 461.58
6Claude Sonnet 4.661.5
7Claude Sonnet 4.561.46
8Claude Opus 4.861.35
9GPT-561.17
10Gemini 2.5 Pro60.84
11GPT-4o60.74
12GPT-5.159.79
13Mistral Medium 3.159.47
14GPT-5.459.32
15Gemma 3 27B (IT)58.53

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-nn · How the rankings work · Data refreshed daily, snapshot 2026-07-22.