Evals for Every Language - Language ga — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.575.44
2Claude Opus 4.874.77
3Claude Opus 4.774.57
4Claude Sonnet 474.57
5Gemini 3.1 Flash Lite74.56
6Grok 4.2074.35
7Gemini 3.1 Pro (Preview)74.32
8Claude Sonnet 4.673.97
9GPT-5.173.86
10GPT-4o73.4
11GPT-5.273.18
12GPT-5.571.89
13GPT-571.63
14GPT-5.471.36
15Qwen 3.6 Plus71.35

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ga · How the rankings work · Data refreshed daily, snapshot 2026-07-22.