Evals for Every Language - Language an — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.556.84
2Gemini 2.5 Pro56.08
3Gemini 3.1 Pro (Preview)55.86
4Claude Sonnet 454.78
5Claude Opus 4.754.06
6Claude Opus 4.854.04
7GPT-553.99
8Gemma 3 27B (IT)52.56
9Gemini 3.1 Flash Lite52.49
10Llama 4 Maverick52.46
11Claude Sonnet 4.652.21
12Nova Pro (v1)52.2
13GPT-4o51.9
14Gemini 2.5 Flash51.59
15GPT-5.451.45

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-an · How the rankings work · Data refreshed daily, snapshot 2026-07-22.