EuroEval Dutch Simplification - Duidelijke Taal — leaderboard
Metric: Score (%). Source: euroeval.com. 183 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4.1 Mini | 58.12 |
| 2 | GPT-4.1 Nano | 57.78 |
| 3 | Qwen 3 235B A22B 2507 Instruct | 57.52 |
| 4 | GPT-OSS-20B (Low) | 56.94 |
| 5 | Llama 3.1 405B Instruct FP8 | 56.6 |
| 6 | Gemma 4 26B A4B (IT) | 56.42 |
| 7 | Qwen 3 14B (Non-reasoning) | 56.34 |
| 8 | gemma-3-27B-pt | 56.24 |
| 9 | GPT-OSS-120B | 55.82 |
| 10 | GPT-5.4 Mini (Medium) | 55.55 |
| 11 | EuroLLM-22B-Instruct-2512 | 54.88 |
| 12 | GPT-5.2 | 54.77 |
| 13 | GPT-4.1 | 54.68 |
| 14 | Llama 3.1 70B | 54.57 |
| 15 | gemma-3-12B-pt | 54.44 |
Interactive version: theaggregate.ai/benchmark?slug=euroeval-dutch-simplification-duidelijke-taal · How the rankings work · Data refreshed daily, snapshot 2026-07-22.