Evals for Every Language - Language sl — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.576.86
2Gemini 3.1 Flash Lite76.55
3Gemini 3.1 Pro (Preview)75.91
4GPT-5.174.8
5Claude Sonnet 474.56
6GPT-574.53
7GPT-5.274.2
8Gemini 2.5 Pro74.14
9Claude Opus 4.773.96
10Grok 4.2073.54
11Claude Sonnet 4.673.48
12Claude Opus 4.872.65
13GPT-5.472.3
14GPT-5 Mini71.57
15GPT-5.571.45

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sl · How the rankings work · Data refreshed daily, snapshot 2026-07-22.