Evals for Every Language - Language aeb: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)53.74
2Gemini 3.1 Flash Lite53.18
3Claude Sonnet 4.551.97
4Claude Opus 4.750.61
5Claude Opus 4.850.53
6Gemini 2.5 Pro50.19
7Claude Sonnet 448.82
8Claude Sonnet 4.648.46
9Command A48.44
10GPT-5.247.89
11GPT-4o47.6
12Gemini 2.5 Flash Lite47.28
13GPT-546.56
14GPT-5.346.27
15Gemini 2.5 Flash45.89

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-aeb · How It Works · Data refreshed daily, snapshot 2026-09-05.