EuroEval Italian Summarization - Ilpost SUM — leaderboard

Metric: Score (%). Source: euroeval.com. 151 models tracked.

Top models

#ModelScore
1Mistral Small 3.139.2
2gemma-4-E2B-it38.97
3gemma-4-E4B-it38.85
4GPT-4.138.72
5Apertus-70B-Instruct-250938.7
6Bielik-11B-v2.3-Instruct38.66
7Gemma 3 12B (IT)38.63
8Qwen 3 14B (Non-reasoning)38.58
9Qwen 3 8B (Non-reasoning)38.55
10Gemma 3 27B (IT)38.42
11Gemma 4 26B A4B (IT)38.42
12Gemma 4 31B (IT)38.37
13GPT-5.4 Mini (Non-reasoning)38.35
14Mistral Small 3.238.3
15Gemma 3n E4B (IT)38.28

Interactive version: theaggregate.ai/benchmark?slug=euroeval-italian-summarization-ilpost-sum · How the rankings work · Data refreshed daily, snapshot 2026-07-22.