EuroEval Serbian NLU - MultiWikiQA SR — leaderboard

Metric: Reading comprehension Score (%). Source: euroeval.com. 205 models tracked.

Top models

#ModelScore
1Ministral-3-14B-Reasoning-251268.07
2Ministral 3 14B67.72
3Mistral Small 3.267.16
4gemma-3-27B-pt66.09
5Llama 3.1 70B65.97
6GPT-5 Mini65.59
7Qwen 3 14B (Non-reasoning)65.41
8GPT-5.4 Mini (Medium)65.23
9GPT-5.4 Mini (Non-reasoning)65.17
10GPT-5.265
11Gemini 3 Pro (Preview)64.13
12SOLAR-10.7B-v1.064.1
13Grok 4.1 Fast (Reasoning)63.97
14Ministral 3 3B63.89
15Claude Sonnet 4.5 (Non-reasoning)63.43

Interactive version: theaggregate.ai/benchmark?slug=euroeval-serbian-nlu-multiwikiqa-sr · How the rankings work · Data refreshed daily, snapshot 2026-07-22.