Evals for Every Language - Language gd: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.872.85
2Gemini 3.1 Pro (Preview)72.36
3Claude Opus 4.771.96
4Claude Sonnet 4.570.94
5GPT-5.569.99
6GPT-5.369.23
7Grok 4.2069.01
8Qwen 3.6 Plus68.87
9Gemini 2.5 Pro68.38
10Claude Sonnet 468.11
11GPT-5.167.95
12GPT-567.58
13GPT-5.467.24
14GPT-5.267.14
15Gemini 3.1 Flash Lite66.33

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-gd · How It Works · Data refreshed daily, snapshot 2026-09-05.