Evals for Every Language - Language en — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite87.28
2Claude Opus 4.886.15
3Gemini 3.1 Pro (Preview)85.6
4GPT-5.585.03
5Claude Opus 4.784.79
6Claude Sonnet 4.684.4
7Grok 4.2084.29
8Qwen 3.6 Plus82.75
9GPT-5.281.79
10nova-2-lite-v181.54
11GPT-5.481.52
12DeepSeek V3.180.49
13Qwen 3 30B A3B79.93
14Qwen 3 30B A3B 2507 Instruct78.55
15GPT-OSS-20B77.2

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-en · How the rankings work · Data refreshed daily, snapshot 2026-07-22.