Evals for Every Language - Language new: leaderboard

Metric: Average Score (%). Source: huggingface.co. 67 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)96.3
2Qwen 3.6 Plus93.33
3Gemini 2.5 Pro90
4Claude Opus 4.790
5Claude Opus 4.890
6Gemini 3.1 Flash Lite88.89
7Claude Sonnet 4.687.5
8GPT-5.586.67
9Qwen 3.6 Flash86.67
10Grok 4.2080
11GPT-5.273.33
12Gemini 2.5 Flash Lite63.33
13granite-4.0-h-micro62.5
14GPT-5.461.11
15Qwen 3 30B A3B 2507 Instruct58.33

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-new · How It Works · Data refreshed daily, snapshot 2026-09-05.