Evals for Every Language - Language new — leaderboard

Metric: Average Score (%). Source: huggingface.co. 67 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)96.3
2Qwen 3.6 Plus93.33
3Gemini 2.5 Pro90
4Claude Opus 4.790
5Claude Opus 4.890
6Gemini 3.1 Flash Lite88.89
7Claude Sonnet 4.687.5
8GPT-5.586.67
9Grok 4.2080
10GPT-5.273.33
11Gemini 2.5 Flash Lite63.33
12granite-4.0-h-micro62.5
13GPT-5.461.11
14Qwen 3 30B A3B 2507 Instruct58.33
15Claude Sonnet 4.556.67

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-new · How the rankings work · Data refreshed daily, snapshot 2026-07-22.