Evals for Every Language - Language gl: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)73.21
2Claude Opus 4.872.87
3GPT-572.31
4Gemini 2.5 Pro71.5
5Claude Sonnet 4.671.13
6Claude Sonnet 470.87
7Claude Sonnet 4.570.76
8GPT-4o70.66
9Gemini 3.1 Flash Lite70.25
10GPT-5.270.17
11GPT-5.369.95
12GPT-5.169.62
13Grok 4.2069.6
14GPT-5.569.31
15Claude Opus 4.769.02

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-gl · How It Works · Data refreshed daily, snapshot 2026-09-05.