Evals for Every Language - Language hu — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.874.93
2Gemini 3.1 Pro (Preview)74.5
3Gemini 3.1 Flash Lite74.26
4Claude Opus 4.774.18
5Qwen 3.6 Plus73.07
6Claude Sonnet 4.672.64
7Claude Sonnet 4.572.41
8GPT-571.43
9DeepSeek V3.171.39
10Grok 4.2071.3
11GPT-5.471.01
12Gemini 2.5 Pro70.61
13Claude Sonnet 469.8
14GPT-5.569.64
15GPT-4o69.46

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-hu · How the rankings work · Data refreshed daily, snapshot 2026-07-22.