Evals for Every Language - Language zgh: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.646.84
2Gemini 2.5 Pro41
3GPT-5.539.49
4Gemini 2.5 Flash36.01
5Claude Opus 4.834.61
6Claude Opus 4.734.43
7Gemini 3.1 Pro (Preview)34.26
8GPT-5.334.01
9Gemini 3.1 Flash Lite33.46
10GPT-5.431.47
11Llama 4 Maverick29.4
12Qwen 3.6 Plus29.4
13Claude Sonnet 4.529.2
14GPT-5.226.34
15Grok 4.2025.78

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-zgh · How It Works · Data refreshed daily, snapshot 2026-09-05.