Evals for Every Language - Language sw: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)76.71
2Gemini 3.1 Flash Lite76.38
3Claude Sonnet 4.675.73
4Claude Opus 4.775.42
5Grok 4.2075.01
6Claude Opus 4.874.3
7GPT-5.373.55
8GPT-5.273.32
9GPT-5.572.27
10GPT-5.471.91
11Qwen 3.6 Plus70.23
12Qwen 3.6 Flash68.76
13Gemini 2.5 Pro67.18
14GPT-5.166.86
15Claude Sonnet 4.566.17

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sw · How It Works · Data refreshed daily, snapshot 2026-09-05.