Evals for Every Language - Language kea: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro62.21
2Gemini 3.1 Pro (Preview)61.08
3Gemini 2.5 Flash58.07
4Claude Sonnet 4.556.3
5GPT-5.455.33
6Claude Opus 4.754.47
7Gemini 3.1 Flash Lite53.5
8GPT-553.13
9GPT-4o52.85
10Claude Sonnet 452.85
11GPT-5.552.65
12GPT-5.151.98
13Claude Opus 4.851.91
14GPT-5.351.39
15Grok 4.2050.26

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-kea · How It Works · Data refreshed daily, snapshot 2026-09-05.