EuroEval English NLU - CoNLL EN — leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 333 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)89.97
2Gemini 3 Flash (Preview) (Non-reasoning)89.2
3GPT-5 (High)88.6
4Claude Sonnet 4.5 (Non-reasoning)88.59
5Gemma 4 31B (IT)88.53
6Gemma 4 26B A4B (IT)87.04
7Gemini 3 Pro (Preview)86.89
8Qwen 3 Next 80B A3B (Thinking)86.82
9O3 (2025-04-16)86.49
10Qwen 3 4B 2507 (Thinking)86.34
11GPT-5.4 Mini (High)85.75
12GPT-585.59
13GPT-5.4 Mini (Medium)85.19
14Qwen 3 235B A22B84.93
15Grok 4.1 Fast (Reasoning)84.82

Interactive version: theaggregate.ai/benchmark?slug=euroeval-english-nlu-conll-en · How the rankings work · Data refreshed daily, snapshot 2026-07-22.