Evals for Every Language - Language mai — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)70.54
2Gemini 2.5 Pro69.95
3Claude Sonnet 4.569.23
4Claude Sonnet 468.61
5Claude Opus 4.768.5
6Claude Opus 4.868.44
7GPT-5.168.44
8GPT-5.568.16
9GPT-567.81
10GPT-5.266.76
11Qwen 3.6 Plus66.65
12GPT-4o66.29
13Grok 4.2066.2
14GPT-4.165.99
15GPT-5.465.84

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mai · How the rankings work · Data refreshed daily, snapshot 2026-07-22.