Evals for Every Language - Language kac: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)42.92
2Claude Opus 4.739.86
3Gemini 2.5 Pro37.79
4GPT-5.536.93
5Gemini 3.1 Flash Lite36.66
6Claude Opus 4.836.24
7Grok 4.2034.56
8GPT-5.334.41
9GPT-5.434.4
10DeepSeek V3.2 Exp32.9
11Kimi K232.37
12Gemini 2.5 Flash31.98
13Claude Sonnet 4.530.27
14Claude Sonnet 4.629.46
15DeepSeek V3.129.46

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-kac · How It Works · Data refreshed daily, snapshot 2026-09-05.