Evals for Every Language - Language ks — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1GPT-5.545.36
2Claude Sonnet 4.545.3
3Gemini 2.5 Pro44.55
4Gemini 3.1 Pro (Preview)44.06
5Gemini 2.5 Flash43.89
6Claude Opus 4.741.93
7Claude Sonnet 441.93
8GPT-5.140.16
9Grok 4.2039.56
10Gemini 2.5 Flash Lite39.39
11GPT-538.76
12Qwen 3.6 Plus38.62
13GPT-5.237.92
14Gemini 3.1 Flash Lite37.88
15GPT-5.436.86

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ks · How the rankings work · Data refreshed daily, snapshot 2026-07-22.