EuroEval Italian — leaderboard

Metric: Average Score (%). Source: euroeval.com. 435 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)72.45
2Gemma 4 31B (IT)71.18
3Claude Sonnet 4.670.59
4Gemini 3 Flash (Preview) (Non-reasoning)69.82
5Gemini 3.1 Flash Lite (Preview)69.46
6Qwen 3 235B A22B 2507 Instruct68.86
7GPT-5 (High)68.09
8GPT-567.88
9GPT-5.4 Mini (High)67.32
10Claude Sonnet 4.5 (Thinking)67.31
11Qwen 3 Next 80B A3B Instruct67.31
12Llama 3.1 405B Instruct FP867.23
13Qwen 3 Next 80B A3B (Thinking)66.99
14Claude 3.7 Sonnet (20250219) (Thinking)66.85
15Gemma 4 26B A4B (IT)66.36

Interactive version: theaggregate.ai/benchmark?slug=euroeval-italian · How the rankings work · Data refreshed daily, snapshot 2026-07-22.