Evals for Every Language - Language ach: leaderboard

Metric: Average Score (%). Source: huggingface.co. 68 models tracked.

Top models

#ModelScore
1GPT-5.586.3
2Gemini 3.1 Pro (Preview)85.83
3Claude Opus 4.783.33
4Claude Opus 4.881.85
5Gemini 2.5 Pro80
6Grok 4.2080
7Claude Sonnet 4.679.17
8GPT-5.468.52
9GPT-5.166.67
10Gemini 3.1 Flash Lite66.67
11GPT-565.56
12GPT-5.361.11
13Claude Sonnet 4.560
14GPT-5.253.33
15Claude Sonnet 450

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ach · How It Works · Data refreshed daily, snapshot 2026-09-05.