Evals for Every Language - Language kk — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)72.01
2GPT-5.271.74
3Claude Opus 4.771.43
4Claude Sonnet 470.39
5GPT-5.569.54
6Claude Opus 4.869.18
7Gemini 3.1 Flash Lite69.04
8Qwen 3.6 Plus68.95
9Claude Sonnet 4.568.89
10GPT-568.49
11Claude Sonnet 4.668.46
12GPT-5.168.22
13GPT-5.467.6
14Grok 4.2067.59
15Gemini 2.5 Pro67.38

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-kk · How the rankings work · Data refreshed daily, snapshot 2026-07-22.