EuroEval German NLU - GermEval — leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 323 models tracked.

Top models

#ModelScore
1Qwen 3 4B 2507 (Thinking)78.27
2GPT-5.4 Mini (High)77.95
3Claude Sonnet 4.5 (Thinking)77.06
4GPT-5.4 Mini (Medium)76.2
5GPT-575.28
6Gemma 4 31B (IT)75.25
7OLMo 3.1 32B (Thinking)74.37
8Gemma 4 26B A4B (IT)74.21
9Claude Sonnet 4.5 (Non-reasoning)74.2
10Qwen 3 Next 80B A3B (Thinking)74.11
11GPT-5 (High)73.8
12Qwen 3 14B73.49
13Qwen 3 30B A3B73.17
14Llama 3.1 405B Instruct FP872.32
15QwQ-32B71.84

Interactive version: theaggregate.ai/benchmark?slug=euroeval-german-nlu-germeval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.