Evals for Every Language - Language id — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.574.98
2Gemini 3.1 Pro (Preview)74.66
3Claude Opus 4.874.47
4Claude Opus 4.774.12
5Gemini 3.1 Flash Lite73.88
6Claude Sonnet 4.673.48
7Gemini 2.5 Pro72.67
8GPT-5.272.26
9Claude Sonnet 471.85
10GPT-571.33
11GPT-5.171.01
12DeepSeek V3.2 Exp70.66
13Qwen 3.6 Plus70.62
14Command A70.35
15Mistral Medium 3.170.3

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-id · How the rankings work · Data refreshed daily, snapshot 2026-07-22.