Evals for Every Language - Language kmb — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)42.26
2Claude Opus 4.737.11
3Gemini 2.5 Pro36.95
4Claude Sonnet 4.535.85
5Gemini 3.1 Flash Lite34.31
6GPT-5.533.37
7DeepSeek V3.2 Exp33.25
8Claude Sonnet 4.632.45
9Mistral Medium 3.132.45
10Gemini 2.5 Flash32.33
11Claude Opus 4.831.62
12GPT-5.430.97
13Command A30.39
14Gemma 3 27B (IT)30.12
15Llama 4 Maverick28.97

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-kmb · How the rankings work · Data refreshed daily, snapshot 2026-07-22.