Evals for Every Language - Language szl: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1GPT-5.571.4
2Gemini 3.1 Pro (Preview)71.36
3Claude Opus 4.869.86
4Claude Sonnet 4.569.85
5Gemini 3.1 Flash Lite69.81
6Claude Sonnet 469.44
7GPT-5.169.22
8Claude Opus 4.768.88
9Gemini 2.5 Pro68.86
10GPT-5.268.73
11DeepSeek V3.2 Exp68.59
12GPT-5.367.4
13Claude Sonnet 4.667.26
14Qwen 3.6 Plus67.21
15GPT-5.466.72

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-szl · How It Works · Data refreshed daily, snapshot 2026-09-05.