Evals for Every Language - Language ceb — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite78.06
2Gemini 3.1 Pro (Preview)77.77
3Claude Sonnet 4.576.66
4GPT-5.176
5Claude Opus 4.875.82
6Gemini 2.5 Pro75.18
7Claude Opus 4.775.18
8Grok 4.2074.99
9GPT-5.274.67
10GPT-5.574.54
11Claude Sonnet 474.07
12GPT-4o73.71
13GPT-5.473.65
14Llama 4 Maverick72.93
15Claude Sonnet 4.672.73

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ceb · How the rankings work · Data refreshed daily, snapshot 2026-07-22.