EuroEval Croatian NLU - Multi Wiki QA HR — leaderboard

Metric: Reading comprehension Score (%). Source: euroeval.com. 211 models tracked.

Top models

#ModelScore
1Ministral-3-14B-Reasoning-251273.9
2Ministral 3 14B69.62
3Bielik-11B-v2.3-Instruct69.45
4SOLAR-10.7B-v1.068.75
5Mistral Small 3.268.62
6Qwen 3 14B (Non-reasoning)68.16
7Ministral-3-14B-Instruct-251267.67
8Gemini 3 Pro (Preview)67.64
9GPT-5.267.02
10Llama 3.1 70B66.7
11GPT-5.4 Mini (Non-reasoning)66.55
12Ministral-3-3B-Reasoning-251266.43
13GPT-5.4 Mini (Medium)66.25
14Gemini 2.5 Flash (Thinking)65.65
15gemma-4-E2B-it65.47

Interactive version: theaggregate.ai/benchmark?slug=euroeval-croatian-nlu-multi-wiki-qa-hr · How the rankings work · Data refreshed daily, snapshot 2026-07-22.