Evals for Every Language - Language ceb: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite78.06
2Gemini 3.1 Pro (Preview)77.77
3Claude Sonnet 4.576.66
4GPT-5.176
5Claude Opus 4.875.82
6Gemini 2.5 Pro75.18
7Claude Opus 4.775.18
8Grok 4.2074.99
9GPT-5.274.67
10GPT-5.574.54
11Claude Sonnet 474.07
12GPT-5.374.06
13GPT-4o73.71
14GPT-5.473.65
15Llama 4 Maverick72.93

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ceb · How It Works · Data refreshed daily, snapshot 2026-09-05.