Evals for Every Language - Language sq — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)75.41
2Claude Sonnet 4.574.73
3Grok 4.2073.1
4Claude Sonnet 473.07
5Gemini 3.1 Flash Lite72.3
6GPT-572.09
7Claude Sonnet 4.671.93
8GPT-5.571.41
9Claude Opus 4.871.02
10Claude Opus 4.770.97
11GPT-5.270.78
12Qwen 3.6 Plus70.76
13GPT-5.170.46
14DeepSeek V3.170.06
15GPT-5.469.96

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sq · How the rankings work · Data refreshed daily, snapshot 2026-07-22.