Evals for Every Language - Language sk: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.873.72
2Gemini 3.1 Pro (Preview)72.66
3Gemini 2.5 Pro72.45
4Claude Opus 4.772.44
5Claude Sonnet 4.571.98
6GPT-5.171.07
7GPT-570.92
8Grok 4.2070.81
9DeepSeek V3.170.29
10Gemini 3.1 Flash Lite69.29
11GPT-5.369.05
12Claude Sonnet 469.04
13GPT-5.568.83
14Claude Sonnet 4.668.61
15Mistral Medium 3.168.31

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sk · How It Works · Data refreshed daily, snapshot 2026-09-05.