Evals for Every Language - Language su: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.770.66
2Claude Opus 4.869.97
3Claude Sonnet 4.669.64
4Gemini 3.1 Pro (Preview)69.43
5Claude Sonnet 4.568.89
6Qwen 3.6 Plus68.18
7Grok 4.2067.61
8GPT-5.367.4
9Claude Sonnet 467.34
10Gemini 3.1 Flash Lite66.97
11GPT-5.266.57
12GPT-5.566.24
13GPT-5.166.2
14Gemini 2.5 Pro66.11
15DeepSeek V3.165.93

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-su · How It Works · Data refreshed daily, snapshot 2026-09-05.