Evals for Every Language - Language gd — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.872.85
2Gemini 3.1 Pro (Preview)72.36
3Claude Opus 4.771.96
4Claude Sonnet 4.570.94
5GPT-5.569.99
6Grok 4.2069.01
7Qwen 3.6 Plus68.87
8Gemini 2.5 Pro68.38
9Claude Sonnet 468.11
10GPT-5.167.95
11GPT-567.58
12GPT-5.467.24
13GPT-5.267.14
14Gemini 3.1 Flash Lite66.33
15GPT-4.166.06

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-gd · How the rankings work · Data refreshed daily, snapshot 2026-07-22.