Evals for Every Language - Language ban — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)65.8
2Claude Opus 4.765.75
3DeepSeek V3.165.1
4Claude Opus 4.863.8
5GPT-5.163.45
6GPT-5.562.74
7Qwen 3.6 Plus62.52
8Grok 4.2062.23
9Claude Sonnet 4.661.91
10GPT-5.461.78
11Claude Sonnet 4.561.42
12Claude Sonnet 461.22
13GPT-560.6
14Gemini 2.5 Pro59.81
15DeepSeek V3.2 Exp58.38

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ban · How the rankings work · Data refreshed daily, snapshot 2026-07-22.