Evals for Every Language - Language kac — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)42.92
2Claude Opus 4.739.86
3Gemini 2.5 Pro37.79
4GPT-5.536.93
5Gemini 3.1 Flash Lite36.66
6Claude Opus 4.836.24
7Grok 4.2034.56
8GPT-5.434.4
9DeepSeek V3.2 Exp32.9
10Kimi K232.37
11Gemini 2.5 Flash31.98
12Claude Sonnet 4.530.27
13Claude Sonnet 4.629.46
14DeepSeek V3.129.46
15Gemma 3 27B (IT)29.03

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-kac · How the rankings work · Data refreshed daily, snapshot 2026-07-22.