EuroEval Romanian NLU - RoSent — leaderboard

Metric: Sentiment classification Score (%). Source: euroeval.com. 207 models tracked.

Top models

#ModelScore
1GPT-5 Mini98.51
2Llama 3.3 70B Instruct98.47
3Gemma 3 27B (IT)97.74
4Qwen 2.5 72B Instruct97.62
5Claude Sonnet 4.5 (Non-reasoning)97.6
6Mistral Small 3.197.56
7Grok 4.1 Fast (Reasoning)97.5
8GPT-5.4 Mini (Non-reasoning)97.22
9Gemma 3 12B (IT)97.15
10GPT-597.1
11Qwen 3 14B (Non-reasoning)96.98
12Mistral Small 3.296.97
13Gemini 3 Flash (Preview) (Non-reasoning)96.82
14Claude Sonnet 4.5 (Thinking)96.8
15Gemini 3 Pro (Preview)96.79

Interactive version: theaggregate.ai/benchmark?slug=euroeval-romanian-nlu-rosent · How the rankings work · Data refreshed daily, snapshot 2026-07-22.