Evals for Every Language - Language sd: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.771.63
2Gemini 3.1 Pro (Preview)71.51
3Gemini 2.5 Pro71.03
4Gemini 3.1 Flash Lite70.74
5Claude Sonnet 4.570.49
6GPT-5.170.12
7GPT-5.369.99
8GPT-4o69.14
9Claude Sonnet 469
10Qwen 3.6 Plus68.91
11GPT-5.468.88
12GPT-5.568.86
13Claude Opus 4.868.48
14Claude Sonnet 4.668.42
15GPT-568.13

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sd · How It Works · Data refreshed daily, snapshot 2026-09-05.