Evals for Every Language - Language hne — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Opus 4.751.52
2Gemini 3.1 Pro (Preview)50.91
3Gemini 2.5 Pro50.37
4GPT-5.448.55
5GPT-5.148.09
6Gemini 2.5 Flash Lite47.41
7GPT-5.547.35
8Claude Sonnet 4.647.31
9Claude Sonnet 4.546.74
10Claude Sonnet 446.64
11GPT-4o46.21
12Nova Pro (v1)46.15
13Gemini 2.5 Flash45.9
14Command A45.8
15Gemini 3.1 Flash Lite44.92

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-hne · How the rankings work · Data refreshed daily, snapshot 2026-07-22.