EuroEval Greek NLU - ELNER — leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 204 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)81.13
2GPT-5 Nano80.71
3GPT-5.4 Mini (High)80.26
4GPT-5.4 Mini (Medium)79.92
5Claude Sonnet 4.679.63
6Gemini 3.1 Flash Lite (Preview)78.88
7Gemma 4 31B (IT)77.95
8Gemini 3 Flash (Preview) (Non-reasoning)77.77
9Gemini 3 Pro (Preview)77.21
10Gemma 4 26B A4B (IT)75.82
11GPT-574.59
12Llama 3.3 70B Instruct74.21
13Grok 4.1 Fast (Reasoning)72.87
14Gemini 2.5 Pro72.71
15Mistral Small 3.272.57

Interactive version: theaggregate.ai/benchmark?slug=euroeval-greek-nlu-elner · How the rankings work · Data refreshed daily, snapshot 2026-07-22.