Evals for Every Language - Language as: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)69.38
2Claude Opus 4.768.11
3GPT-5.367.23
4Claude Opus 4.866.93
5Gemini 2.5 Pro66.33
6Qwen 3.6 Plus66.13
7GPT-566.04
8GPT-5.566.04
9Claude Sonnet 4.665.28
10GPT-5.264.84
11DeepSeek V3.164.63
12GPT-5.164.43
13GPT-5.464.14
14Grok 4.2064.04
15Claude Sonnet 462.62

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-as · How It Works · Data refreshed daily, snapshot 2026-09-05.