Evals for Every Language - Language min — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)71.94
2Gemini 2.5 Pro71.1
3Claude Sonnet 4.570.12
4Claude Opus 4.869.79
5DeepSeek V3.169.27
6GPT-5.168.2
7Qwen 3.6 Plus67.66
8GPT-5.567.6
9Claude Sonnet 467.12
10GPT-5.267.07
11Claude Opus 4.766.74
12DeepSeek V3.2 Exp66.62
13Gemini 3.1 Flash Lite66.44
14Claude Sonnet 4.665.74
15GPT-565.63

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-min · How the rankings work · Data refreshed daily, snapshot 2026-07-22.