Evals for Every Language - Language kea — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro62.21
2Gemini 3.1 Pro (Preview)61.08
3Gemini 2.5 Flash58.07
4Claude Sonnet 4.556.3
5GPT-5.455.33
6Claude Opus 4.754.47
7Gemini 3.1 Flash Lite53.5
8GPT-553.13
9GPT-4o52.85
10Claude Sonnet 452.85
11GPT-5.552.65
12GPT-5.151.98
13Claude Opus 4.851.91
14Grok 4.2050.26
15Gemini 2.5 Flash Lite49.08

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-kea · How the rankings work · Data refreshed daily, snapshot 2026-07-22.