Evals for Every Language - Language bug: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)44.81
2Claude Opus 4.842.09
3Claude Opus 4.741.91
4Gemini 3.1 Flash Lite40.71
5Gemini 2.5 Pro39.16
6GPT-5.538.64
7GPT-5.138.55
8Claude Sonnet 438.12
9Claude Sonnet 4.637.26
10Claude Sonnet 4.536.84
11GPT-5.336.52
12DeepSeek V3.135.55
13DeepSeek V3.2 Exp35.31
14GPT-5.435.25
15GPT-535.15

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bug · How It Works · Data refreshed daily, snapshot 2026-09-05.