Evals for Every Language - Language sm — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.872.36
2Gemini 3.1 Pro (Preview)71.3
3GPT-5.570.86
4GPT-568.17
5Claude Opus 4.768.11
6Gemini 2.5 Pro67.8
7Claude Sonnet 4.667.3
8GPT-5.467.25
9GPT-5.167.06
10Grok 4.2066.58
11Gemini 3.1 Flash Lite64.92
12GPT-4o64.37
13Qwen 3.6 Plus64.11
14Claude Sonnet 4.563.1
15DeepSeek V3.2 Exp62.75

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sm · How the rankings work · Data refreshed daily, snapshot 2026-07-22.