Evals for Every Language - Language aeb — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)53.74
2Gemini 3.1 Flash Lite53.18
3Claude Sonnet 4.551.97
4Claude Opus 4.750.61
5Claude Opus 4.850.53
6Gemini 2.5 Pro50.19
7Claude Sonnet 448.82
8Claude Sonnet 4.648.46
9Command A48.44
10GPT-5.247.89
11GPT-4o47.6
12Gemini 2.5 Flash Lite47.28
13GPT-546.56
14Gemini 2.5 Flash45.89
15Qwen 3 30B A3B 2507 Instruct45.53

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-aeb · How the rankings work · Data refreshed daily, snapshot 2026-07-22.