Evals for Every Language - Language kam — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)40.75
2Gemini 3.1 Flash Lite40.59
3Claude Opus 4.740.02
4Gemini 2.5 Pro39.84
5Claude Sonnet 4.539.17
6GPT-5.136.02
7GPT-535.54
8Gemini 2.5 Flash34.97
9Grok 4.2034.9
10GPT-5.534.87
11Mistral Medium 3.134.32
12Claude Opus 4.832.93
13GPT-4o32.92
14Llama 4 Maverick31.75
15Claude Sonnet 4.631.24

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-kam · How the rankings work · Data refreshed daily, snapshot 2026-07-22.