Evals for Every Language - Language ms — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite79.05
2Gemini 3.1 Pro (Preview)78.68
3Claude Sonnet 4.577.74
4Gemini 2.5 Pro77.08
5Claude Sonnet 476.92
6GPT-575.42
7Claude Sonnet 4.675.27
8GPT-5.474.3
9Grok 4.2074.04
10GPT-5.273.94
11Claude Opus 4.773.55
12GPT-5.173.35
13GPT-5.573.27
14Qwen 3.6 Plus73
15DeepSeek V3.2 Exp72.74

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ms · How the rankings work · Data refreshed daily, snapshot 2026-07-22.