Evals for Every Language - Language ab — leaderboard

Metric: Average Score (%). Source: huggingface.co. 67 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)100
2GPT-5.5100
3Claude Opus 4.8100
4Claude Opus 4.796.67
5GPT-5.496.67
6GPT-5.290
7GPT-586.67
8Gemini 3.1 Flash Lite82.22
9Claude Sonnet 4.681.48
10GPT-4.180
11Grok 4.2080
12DeepSeek V3.175
13GPT-5.173.33
14nova-2-lite-v166.67
15GPT-4o63.33

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ab · How the rankings work · Data refreshed daily, snapshot 2026-07-22.