Evals for Every Language - Language zu: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)72.93
2Grok 4.2070.06
3Claude Opus 4.769.52
4Claude Sonnet 4.669.46
5GPT-5.268.89
6GPT-5.368.89
7Claude Opus 4.867.44
8GPT-5.467.24
9Gemini 3.1 Flash Lite66.98
10Qwen 3.6 Plus66.95
11GPT-5.566.94
12DeepSeek V3.164.27
13GPT-5.161.92
14Qwen 3.6 Flash61.74
15GPT-561.12

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-zu · How It Works · Data refreshed daily, snapshot 2026-09-05.