Evals for Every Language - Language zu — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)72.93
2Grok 4.2070.06
3Claude Opus 4.769.52
4Claude Sonnet 4.669.46
5GPT-5.268.89
6Claude Opus 4.867.44
7GPT-5.467.24
8Gemini 3.1 Flash Lite66.98
9Qwen 3.6 Plus66.95
10GPT-5.566.94
11DeepSeek V3.164.27
12GPT-5.161.92
13GPT-561.12
14Claude Sonnet 460.55
15Claude Sonnet 4.560.29

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-zu · How the rankings work · Data refreshed daily, snapshot 2026-07-22.