Evals for Every Language - Language zgh — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.646.84
2Gemini 2.5 Pro41
3GPT-5.539.49
4Gemini 2.5 Flash36.01
5Claude Opus 4.834.61
6Claude Opus 4.734.43
7Gemini 3.1 Pro (Preview)34.26
8Gemini 3.1 Flash Lite33.46
9GPT-5.431.47
10Llama 4 Maverick29.4
11Qwen 3.6 Plus29.4
12Claude Sonnet 4.529.2
13GPT-5.226.34
14Grok 4.2025.78
15Gemini 2.5 Flash Lite24.57

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-zgh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.