EuroEval Spanish Summarization - Mlsum ES: leaderboard

Metric: Score (%). Source: euroeval.com. 148 models tracked.

Top models

#ModelScore
1Gemma 3 27B (IT)29.68
2Qwen 2.5 72B Instruct29.62
3Apertus-70B-Instruct-250929.34
4granite-4.0-h-micro29.33
5Tiny Aya Global28.88
6Llama 3.1 8B Instruct28.87
7Llama 3.3 70B Instruct28.82
8Claude Sonnet 4.5 (Non-reasoning)28.69
9Qwen 3 30B A3B 2507 Instruct28.65
10GPT-4.128.52
11gemma-4-E2B-it28.48
12GPT-5.4 Mini (High)28.21
13Gemma 3 12B (IT)28.16
14GPT-5.4 Mini (Medium)28.11
15Qwen 3.5 2B27.88

Interactive version: theaggregate.ai/benchmark?slug=euroeval-spanish-summarization-mlsum-es · How It Works · Data refreshed daily, snapshot 2026-09-05.