Evals for Every Language - Language gn: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)67.45
2Claude Opus 4.765.2
3GPT-5.364.45
4Claude Opus 4.864.37
5GPT-5.564.25
6Gemini 2.5 Pro63.5
7GPT-5.462
8Gemini 3.1 Flash Lite61.84
9Grok 4.2060.81
10GPT-560.74
11Qwen 3.6 Plus59.08
12Claude Sonnet 4.558.89
13GPT-5.257.43
14Claude Sonnet 4.655.91
15GPT-5.155.1

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-gn · How It Works · Data refreshed daily, snapshot 2026-09-05.