Evals for Every Language - Language ha — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)70.78
2Claude Opus 4.869.33
3Gemini 3.1 Flash Lite67.01
4Claude Sonnet 4.665.91
5GPT-5.565.64
6Claude Opus 4.764.87
7GPT-5.464.86
8GPT-5.263.94
9Grok 4.2063.48
10Qwen 3.6 Plus62.73
11Claude Sonnet 4.560.84
12Gemini 2.5 Pro57.55
13GPT-557.13
14DeepSeek V3.154.73
15GLM 4.5 Air54.57

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ha · How the rankings work · Data refreshed daily, snapshot 2026-07-22.