Evals for Every Language - Language or — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.571.09
2Claude Opus 4.770.75
3Claude Sonnet 469.83
4Gemini 3.1 Pro (Preview)69.1
5Claude Opus 4.868.87
6GPT-5.167.54
7Qwen 3.6 Plus66.98
8Grok 4.2066.35
9GPT-4o66.26
10GPT-5.566.14
11DeepSeek V3.165.72
12Claude Sonnet 4.664.78
13GPT-5.464.31
14GPT-5.264.01
15GPT-563.78

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-or · How the rankings work · Data refreshed daily, snapshot 2026-07-22.