EuroEval Spanish NLU - CoNLL ES — leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 412 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)86.12
2GPT-5.4 Mini (High)83.02
3Claude 3.7 Sonnet (20250219) (Thinking)80.95
4GPT-5.4 Mini (Medium)80.63
5Gemini 3 Pro (Preview)79.88
6GPT-5 (High)79.47
7Qwen 3 4B 2507 (Thinking)79.34
8O3 (2025-04-16)79.28
9Claude Sonnet 4.679.02
10Gemini 3.1 Flash Lite (Preview)78.37
11GPT-578.06
12Qwen 3 14B78.03
13Llama 3.1 70B Instruct77.93
14Qwen 3 30B A3B77.85
15QwQ-32B77.69

Interactive version: theaggregate.ai/benchmark?slug=euroeval-spanish-nlu-conll-es · How the rankings work · Data refreshed daily, snapshot 2026-07-22.