Evals for Every Language - Language min: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)71.94
2Gemini 2.5 Pro71.1
3Claude Sonnet 4.570.12
4Claude Opus 4.869.79
5DeepSeek V3.169.27
6GPT-5.168.2
7Qwen 3.6 Plus67.66
8GPT-5.567.6
9GPT-5.367.18
10Claude Sonnet 467.12
11GPT-5.267.07
12Claude Opus 4.766.74
13DeepSeek V3.2 Exp66.62
14Gemini 3.1 Flash Lite66.44
15Claude Sonnet 4.665.74

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-min · How It Works · Data refreshed daily, snapshot 2026-09-05.