EuroEval Italian NLU - Sentipolc16 — leaderboard

Metric: Sentiment classification Score (%). Source: euroeval.com. 435 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)75.6
2GPT-573.43
3Gemma 4 31B (IT)72.07
4Claude Sonnet 4.5 (Non-reasoning)71.36
5GPT-5 (High)71.22
6Claude 3.7 Sonnet (20250219) (Thinking)71.05
7O3 (2025-04-16)71
8Claude Sonnet 4.5 (Thinking)70.89
9Claude 3.5 Sonnet (20241022)70.47
10O4 Mini (2025-04-16)70.34
11Gemini 3 Flash (Preview) (Non-reasoning)69.78
12Gemini 3.1 Flash Lite (Preview)69.24
13Gemini 2.5 Pro68.7
14GPT-5.4 Mini (Medium)68.61
15GPT-5.4 Mini (High)68.44

Interactive version: theaggregate.ai/benchmark?slug=euroeval-italian-nlu-sentipolc16 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.