Evals for Every Language - Language ss — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)69.6
2GPT-567.27
3GPT-5.567.2
4Qwen 3.6 Plus66.07
5Gemini 2.5 Pro64.94
6GPT-5.164.71
7Claude Opus 4.764.54
8Claude Sonnet 4.664.37
9GPT-5.464.3
10Grok 4.2064.21
11GPT-5.263.83
12DeepSeek V3.163.41
13Claude Opus 4.862.4
14Gemini 3.1 Flash Lite61.2
15Claude Sonnet 460.22

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ss · How the rankings work · Data refreshed daily, snapshot 2026-07-22.