Evals for Every Language - Language hr — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.28
2Claude Sonnet 4.672.85
3Claude Opus 4.772.71
4Gemini 2.5 Pro72.65
5Claude Sonnet 4.572.4
6GPT-5.272.38
7Gemini 3.1 Flash Lite71.41
8GPT-571.21
9GPT-5.171.08
10Claude Sonnet 470.98
11Claude Opus 4.870.94
12Grok 4.2069.63
13jamba-large-1.769.63
14Mistral Medium 3.169.06
15Gemma 3 27B (IT)68.88

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-hr · How the rankings work · Data refreshed daily, snapshot 2026-07-22.