Evals for Every Language - Language ak — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.43
2Claude Opus 4.860.02
3Claude Opus 4.759.75
4GPT-5.557.86
5Gemini 2.5 Pro56.18
6Grok 4.2056.11
7Claude Sonnet 4.556.05
8GPT-5.455.22
9Claude Sonnet 4.652.33
10Gemini 3.1 Flash Lite52.14
11GPT-552.1
12GPT-5.252.02
13GPT-5.151.29
14Qwen 3.6 Plus51.2
15DeepSeek V3.2 Exp50.23

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ak · How the rankings work · Data refreshed daily, snapshot 2026-07-22.