Evals for Every Language - Language hr: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.28
2Claude Sonnet 4.672.85
3Claude Opus 4.772.71
4Gemini 2.5 Pro72.65
5Claude Sonnet 4.572.4
6GPT-5.272.38
7GPT-5.371.44
8Gemini 3.1 Flash Lite71.41
9GPT-571.21
10GPT-5.171.08
11Claude Sonnet 470.98
12Claude Opus 4.870.94
13Grok 4.2069.63
14jamba-large-1.769.63
15Mistral Medium 3.169.06

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-hr · How It Works · Data refreshed daily, snapshot 2026-09-05.