Evals for Every Language - Language sd — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.771.63
2Gemini 3.1 Pro (Preview)71.51
3Gemini 2.5 Pro71.03
4Gemini 3.1 Flash Lite70.74
5Claude Sonnet 4.570.49
6GPT-5.170.12
7GPT-4o69.14
8Claude Sonnet 469
9Qwen 3.6 Plus68.91
10GPT-5.468.88
11GPT-5.568.86
12Claude Opus 4.868.48
13Claude Sonnet 4.668.42
14GPT-568.13
15GPT-5.268.09

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sd · How the rankings work · Data refreshed daily, snapshot 2026-07-22.