EuroEval English NLU: leaderboard

Metric: NLU Average Score (%). Source: euroeval.com. 341 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)77.22
2Claude Sonnet 4.677.12
3Gemini 3.1 Flash Lite (Preview)76.79
4GPT-5.4 Mini (Medium)76.66
5Gemini 3 Pro (Preview)76.03
6Grok 4.1 Fast (Reasoning)75.92
7Gemma 4 26B A4B (IT)75.35
8GPT-5.4 Mini (High)75.28
9Llama 3.1 70B75.12
10Llama 3.1 405B74.19
11GLM-4.7 Flash73.87
12GPT-5.273.82
13Claude Sonnet 4.5 (Thinking)73.48
14Claude Sonnet 4.5 (Non-reasoning)73.36
15Ministral-3-14B-Reasoning-251273.2

Interactive version: theaggregate.ai/benchmark?slug=euroeval-english-nlu · How It Works · Data refreshed daily, snapshot 2026-09-05.