Evals for Every Language - Language su — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.770.66
2Claude Opus 4.869.97
3Claude Sonnet 4.669.64
4Gemini 3.1 Pro (Preview)69.43
5Claude Sonnet 4.568.89
6Qwen 3.6 Plus68.18
7Grok 4.2067.61
8Claude Sonnet 467.34
9Gemini 3.1 Flash Lite66.97
10GPT-5.266.57
11GPT-5.566.24
12GPT-5.166.2
13Gemini 2.5 Pro66.11
14DeepSeek V3.165.93
15GPT-565.75

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-su · How the rankings work · Data refreshed daily, snapshot 2026-07-22.