Evals for Every Language - Language uz — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)72.09
2Claude Opus 4.771.37
3Claude Sonnet 4.670.79
4Claude Sonnet 470.7
5Claude Sonnet 4.570.3
6GPT-5.570.08
7DeepSeek V3.169.84
8GPT-5.269.04
9Claude Opus 4.868.11
10Qwen 3.6 Plus68.01
11Grok 4.2067.78
12GPT-5.167.64
13DeepSeek V3.2 Exp67.39
14GPT-567.35
15GPT-5.467.14

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-uz · How the rankings work · Data refreshed daily, snapshot 2026-07-22.