EuroEval Polish NLU - KPWr NER — leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 234 models tracked.

Top models

#ModelScore
1GPT-5.4 Mini (High)78.64
2GPT-577.08
3GPT-5.4 Mini (Medium)75.67
4Claude Sonnet 4.5 (Thinking)74.13
5Gemma 4 31B (IT)72.58
6Gemini 3 Flash (Preview) (Non-reasoning)71.92
7Gemma 4 26B A4B (IT)70.61
8Gemini 3 Pro (Preview)69.79
9Qwen 3 4B 2507 (Thinking)69.57
10Qwen 3 Next 80B A3B (Thinking)68.95
11Claude Sonnet 4.667.43
12Gemini 3.1 Flash Lite (Preview)67.37
13Grok 4.1 Fast (Reasoning)66.9
14Gemini 2.5 Pro66.29
15Gemini 2.5 Flash (Thinking)65.71

Interactive version: theaggregate.ai/benchmark?slug=euroeval-polish-nlu-kpwr-ner · How the rankings work · Data refreshed daily, snapshot 2026-07-22.