Evals for Every Language - Language ne — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.771.29
2Gemini 3.1 Pro (Preview)70.85
3Claude Sonnet 4.670.04
4Gemini 2.5 Pro69.96
5Claude Sonnet 468.67
6GPT-568.59
7Claude Sonnet 4.568.4
8Grok 4.2067.96
9GPT-5.167.79
10Gemini 2.5 Flash Lite67.54
11Claude Opus 4.866.75
12GPT-5 Mini66.5
13Gemini 3.1 Flash Lite66.13
14Gemma 3 27B (IT)66.1
15GPT-5.265.76

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ne · How the rankings work · Data refreshed daily, snapshot 2026-07-22.