Evals for Every Language - Language nr — leaderboard

Metric: Average Score (%). Source: huggingface.co. 67 models tracked.

Top models

#ModelScore
1Claude Opus 4.8100
2Gemini 3.1 Flash Lite100
3GPT-5.596.67
4Claude Sonnet 4.696.3
5Gemini 3.1 Pro (Preview)96.3
6DeepSeek V3.194.44
7Grok 4.2093.33
8GPT-590
9GPT-5.290
10Claude Opus 4.790
11GPT-5.490
12DeepSeek V3.2 Exp85.93
13Qwen 3.6 Plus85.83
14GPT-5 Mini85.56
15Gemini 2.5 Pro83.33

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-nr · How the rankings work · Data refreshed daily, snapshot 2026-07-22.