EuroEval English NLU - CoNLL EN: leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 333 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)89.97
2GPT-5 (High)88.6
3Claude Sonnet 4.5 (Non-reasoning)88.59
4Gemma 4 31B (IT)88.53
5Gemma 4 26B A4B (IT)87.04
6Gemini 3 Pro (Preview)86.89
7Qwen 3 Next 80B A3B (Thinking)86.82
8O3 (2025-04-16)86.49
9Qwen 3 4B 2507 (Thinking)86.34
10GPT-5.4 Mini (High)85.75
11GPT-585.59
12GPT-5.4 Mini (Medium)85.19
13Qwen 3 235B A22B84.93
14Grok 4.1 Fast (Reasoning)84.82
15OLMo 3.1 32B (Thinking)84.82

Interactive version: theaggregate.ai/benchmark?slug=euroeval-english-nlu-conll-en · How It Works · Data refreshed daily, snapshot 2026-09-05.