EuroEval Serbian NLU - MultiWikiQA SR: leaderboard

Metric: Reading comprehension Score (%). Source: euroeval.com. 205 models tracked.

Top models

#ModelScore
1Ministral-3-14B-Reasoning-251268.07
2Ministral 3 14B67.72
3Mistral Small 3.267.16
4gemma-3-27B-pt66.09
5Llama 3.1 70B65.97
6GPT-5 Mini65.59
7GPT-5.4 Mini (Medium)65.23
8GPT-5.265
9Gemini 3 Pro (Preview)64.13
10SOLAR-10.7B-v1.064.1
11Grok 4.1 Fast (Reasoning)63.97
12Ministral 3 3B63.89
13Claude Sonnet 4.5 (Non-reasoning)63.43
14Gemini 2.5 Flash (Thinking)63.24
15GPT-5.4 Mini (High)63.23

Interactive version: theaggregate.ai/benchmark?slug=euroeval-serbian-nlu-multiwikiqa-sr · How It Works · Data refreshed daily, snapshot 2026-09-05.