EuroEval Croatian NLU - WikiANN HR — leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 211 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)69.26
2Gemini 3 Pro (Preview)68.98
3Gemma 4 31B (IT)68.87
4Mistral Small 3.268.75
5Qwen 3 4B 2507 (Thinking)67.93
6GPT-5.4 Mini (High)67.85
7Mistral Small 3.167.69
8OLMo 3.1 32B (Thinking)67.54
9Llama 3.1 70B67.53
10MamayLM-Gemma-3-12B-IT-v1.067.14
11Qwen 3 14B (Non-reasoning)67.03
12Gemma 4 26B A4B (IT)66.93
13gemma-3-27B-pt66.66
14GPT-OSS-20B (Low)66.58
15Grok 4.20 Beta (0309) (Reasoning)66.45

Interactive version: theaggregate.ai/benchmark?slug=euroeval-croatian-nlu-wikiann-hr · How the rankings work · Data refreshed daily, snapshot 2026-07-22.