Evals for Every Language - Language ka — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.869.23
2Gemini 3.1 Pro (Preview)68.59
3GPT-5.168.47
4GPT-568.36
5Claude Sonnet 467.85
6Claude Sonnet 4.567.69
7Grok 4.2067.59
8Qwen 3.6 Plus67.1
9GPT-4o67.01
10Claude Opus 4.766.8
11GPT-5.566.58
12Llama 4 Maverick66.54
13GPT-5.266.24
14DeepSeek V3.2 Exp65.99
15Claude Haiku 4.565.96

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ka · How the rankings work · Data refreshed daily, snapshot 2026-07-22.