Evals for Every Language - Language ks: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1GPT-5.545.36
2Claude Sonnet 4.545.3
3Gemini 2.5 Pro44.55
4Gemini 3.1 Pro (Preview)44.06
5Gemini 2.5 Flash43.89
6Claude Opus 4.741.93
7Claude Sonnet 441.93
8GPT-5.341.76
9GPT-5.140.16
10Grok 4.2039.56
11Gemini 2.5 Flash Lite39.39
12GPT-538.76
13Qwen 3.6 Plus38.62
14GPT-5.237.92
15Gemini 3.1 Flash Lite37.88

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ks · How It Works · Data refreshed daily, snapshot 2026-09-05.