Evals for Every Language - Language sat — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1GPT-5.544.28
2Gemini 2.5 Flash43.82
3Gemini 2.5 Pro43.58
4Claude Sonnet 4.543.24
5Claude Sonnet 442.87
6Gemini 3.1 Flash Lite41.4
7Qwen 3.6 Plus40.82
8Claude Opus 4.740.21
9Claude Opus 4.839.68
10DeepSeek V3.2 Exp37.8
11Nova Pro (v1)37.12
12Gemini 3.1 Pro (Preview)36.93
13GPT-5.436.57
14Llama 4 Maverick35.24
15DeepSeek V3.134.7

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.