Evals for Every Language - Language szl — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1GPT-5.571.4
2Gemini 3.1 Pro (Preview)71.36
3Claude Opus 4.869.86
4Claude Sonnet 4.569.85
5Gemini 3.1 Flash Lite69.81
6Claude Sonnet 469.44
7GPT-5.169.22
8Claude Opus 4.768.88
9Gemini 2.5 Pro68.86
10GPT-5.268.73
11DeepSeek V3.2 Exp68.59
12Claude Sonnet 4.667.26
13Qwen 3.6 Plus67.21
14GPT-5.466.72
15GPT-566.58

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-szl · How the rankings work · Data refreshed daily, snapshot 2026-07-22.