EuroEval Polish NLU - KPWr NER: leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 234 models tracked.

Top models

#ModelScore
1GPT-5.4 Mini (High)78.64
2GPT-577.08
3GPT-5.4 Mini (Medium)75.67
4Claude Sonnet 4.5 (Thinking)74.13
5Gemma 4 31B (IT)72.58
6Gemma 4 26B A4B (IT)70.61
7Gemini 3 Pro (Preview)69.79
8Qwen 3 4B 2507 (Thinking)69.57
9Qwen 3 Next 80B A3B (Thinking)68.95
10Claude Sonnet 4.667.43
11Gemini 3.1 Flash Lite (Preview)67.37
12Grok 4.1 Fast (Reasoning)66.9
13Gemini 2.5 Pro66.29
14Gemini 2.5 Flash (Thinking)65.71
15Claude Sonnet 4.5 (Non-reasoning)65.55

Interactive version: theaggregate.ai/benchmark?slug=euroeval-polish-nlu-kpwr-ner · How It Works · Data refreshed daily, snapshot 2026-09-05.