Evals for Every Language - Language shn — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.862.21
2Claude Opus 4.760.06
3GPT-5.559.89
4Gemini 3.1 Pro (Preview)58.57
5Gemini 3.1 Flash Lite52.05
6Qwen 3.6 Plus51.52
7Gemini 2.5 Pro48.83
8Claude Sonnet 4.647.44
9GPT-5.447.32
10GPT-5.244.28
11DeepSeek V3.2 Exp43.95
12Nova Pro (v1)37.97
13nova-2-lite-v136.78
14Gemma 3 27B (IT)36.09
15DeepSeek V3.136.09

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-shn · How the rankings work · Data refreshed daily, snapshot 2026-07-22.