Evals for Every Language - Language sm: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.872.36
2Gemini 3.1 Pro (Preview)71.3
3GPT-5.570.86
4GPT-568.17
5Claude Opus 4.768.11
6GPT-5.367.84
7Gemini 2.5 Pro67.8
8Claude Sonnet 4.667.3
9GPT-5.467.25
10GPT-5.167.06
11Grok 4.2066.58
12Gemini 3.1 Flash Lite64.92
13GPT-4o64.37
14Qwen 3.6 Plus64.11
15Claude Sonnet 4.563.1

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sm · How It Works · Data refreshed daily, snapshot 2026-09-05.