Evals for Every Language - Language ach — leaderboard

Metric: Average Score (%). Source: huggingface.co. 68 models tracked.

Top models

#ModelScore
1GPT-5.586.3
2Gemini 3.1 Pro (Preview)85.83
3Claude Opus 4.783.33
4Claude Opus 4.881.85
5Gemini 2.5 Pro80
6Grok 4.2080
7Claude Sonnet 4.679.17
8GPT-5.468.52
9GPT-5.166.67
10Gemini 3.1 Flash Lite66.67
11GPT-565.56
12Claude Sonnet 4.560
13GPT-5.253.33
14Claude Sonnet 450
15Qwen 3.6 Plus46.67

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ach · How the rankings work · Data refreshed daily, snapshot 2026-07-22.