Evals for Every Language - Language en: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite87.28
2Claude Opus 4.886.15
3Gemini 3.1 Pro (Preview)85.6
4GPT-5.585.03
5Claude Opus 4.784.79
6Claude Sonnet 4.684.4
7Grok 4.2084.29
8GPT-5.383.33
9Qwen 3.6 Plus82.75
10GPT-5.281.79
11nova-2-lite-v181.54
12GPT-5.481.52
13DeepSeek V3.180.49
14Qwen 3 30B A3B79.93
15Qwen 3.6 Flash79.89

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-en · How It Works · Data refreshed daily, snapshot 2026-09-05.