EuroEval Serbian NLU - UNER SR — leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 205 models tracked.

Top models

#ModelScore
1GPT-5.4 Mini (High)88.77
2GPT-5.4 Mini (Medium)88.75
3Claude Sonnet 4.5 (Thinking)87.6
4GPT-587.13
5Claude Sonnet 4.5 (Non-reasoning)85.69
6Qwen 3 4B 2507 (Thinking)85.21
7Gemini 2.5 Flash (Thinking)84.58
8Gemma 4 31B (IT)84.1
9Gemini 3 Flash (Preview) (Non-reasoning)83.15
10Llama 3.3 70B Instruct82.88
11Gemma 4 26B A4B (IT)81.73
12GPT-5 Nano81.22
13Mistral Small 3.181.05
14Claude Sonnet 4.680.97
15Mistral Small 3.280.67

Interactive version: theaggregate.ai/benchmark?slug=euroeval-serbian-nlu-uner-sr · How the rankings work · Data refreshed daily, snapshot 2026-07-22.