Evals for Every Language - Language ff — leaderboard

Metric: Average Score (%). Source: huggingface.co. 67 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)89.63
2DeepSeek V3.183.33
3Claude Opus 4.882.96
4Claude Opus 4.779.17
5GPT-5.578.06
6Claude Sonnet 4.675.93
7DeepSeek V3.2 Exp68.25
8Claude Sonnet 4.566.67
9Grok 4.2066.67
10GPT-5.464.81
11Gemini 3.1 Flash Lite64.29
12Gemini 2.5 Pro63.33
13Claude Sonnet 463.33
14Qwen 3.6 Plus63.33
15GLM 4.5 Air58.33

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ff · How the rankings work · Data refreshed daily, snapshot 2026-07-22.