Evals for Every Language - Language ms: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite79.05
2Gemini 3.1 Pro (Preview)78.68
3Claude Sonnet 4.577.74
4Gemini 2.5 Pro77.08
5Claude Sonnet 476.92
6GPT-575.42
7Claude Sonnet 4.675.27
8GPT-5.375.06
9GPT-5.474.3
10Grok 4.2074.04
11GPT-5.273.94
12Claude Opus 4.773.55
13GPT-5.173.35
14GPT-5.573.27
15Qwen 3.6 Plus73

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ms · How It Works · Data refreshed daily, snapshot 2026-09-05.