EuroEval Spanish NLU - MLQA ES: leaderboard
Metric: Reading comprehension Score (%). Source: euroeval.com. 411 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Ministral 3 14B | 71.15 |
| 2 | Llama 3.1 405B | 70.79 |
| 3 | SOLAR-10.7B-v1.0 | 70.14 |
| 4 | Yi 1.5 34B | 69.63 |
| 5 | Ministral-3-14B-Reasoning-2512 | 69.56 |
| 6 | Magistral Small 1.2 | 69.43 |
| 7 | Ministral 3 8B | 69.37 |
| 8 | Gemma 2 27B | 69.34 |
| 9 | Llama 3 70B | 68.93 |
| 10 | Llama 2 70B Base | 68.79 |
| 11 | Mistral Small 3.2 | 68.58 |
| 12 | Llama 3.1 70B | 68.51 |
| 13 | Mistral Small 3.1 | 68.03 |
| 14 | aya-23-35B | 67.9 |
| 15 | GPT-5 Mini (Minimal) | 67.81 |
Interactive version: theaggregate.ai/benchmark?slug=euroeval-spanish-nlu-mlqa-es · How It Works · Data refreshed daily, snapshot 2026-09-05.