Evals for Every Language - Language bug — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)44.81
2Claude Opus 4.842.09
3Claude Opus 4.741.91
4Gemini 3.1 Flash Lite40.71
5Gemini 2.5 Pro39.16
6GPT-5.538.64
7GPT-5.138.55
8Claude Sonnet 438.12
9Claude Sonnet 4.637.26
10Claude Sonnet 4.536.84
11DeepSeek V3.135.55
12DeepSeek V3.2 Exp35.31
13GPT-5.435.25
14GPT-535.15
15Gemini 2.5 Flash35.13

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bug · How the rankings work · Data refreshed daily, snapshot 2026-07-22.