Evals for Every Language - Language ace — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)70.97
2Claude Opus 4.769.04
3Gemini 3.1 Flash Lite68.13
4GPT-5.567.32
5Claude Opus 4.866.63
6Qwen 3.6 Plus65.27
7Gemini 2.5 Pro65.24
8GPT-563.85
9GPT-5.463.73
10Claude Sonnet 4.563.34
11Grok 4.2062.91
12Claude Sonnet 4.662.61
13Claude Sonnet 461.92
14DeepSeek V3.2 Exp58.55
15GPT-5.158.04

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ace · How the rankings work · Data refreshed daily, snapshot 2026-07-22.