Evals for Every Language - Language sl: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.576.86
2Gemini 3.1 Flash Lite76.55
3Gemini 3.1 Pro (Preview)75.91
4GPT-5.174.8
5Claude Sonnet 474.56
6GPT-574.53
7GPT-5.374.53
8GPT-5.274.2
9Gemini 2.5 Pro74.14
10Claude Opus 4.773.96
11Grok 4.2073.54
12Claude Sonnet 4.673.48
13Claude Opus 4.872.65
14GPT-5.472.3
15GPT-5 Mini71.57

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sl · How It Works · Data refreshed daily, snapshot 2026-09-05.