EuroEval Catalan NLU — leaderboard

Metric: NLU Average Score (%). Source: euroeval.com. 219 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)68.21
2Claude Sonnet 4.667.49
3GPT-5.4 Mini (Non-reasoning)66.84
4GPT-5.266.33
5GPT-4.165.77
6GPT-5.4 Mini (High)65.64
7Bielik-11B-v2.3-Instruct64.9
8Gemini 2.5 Flash (Thinking)64.47
9Gemini 2.5 Pro64.28
10Gemini 3 Flash (Preview) (Non-reasoning)64.25
11GPT-5.4 Mini (Medium)64.24
12Claude Sonnet 4.5 (Thinking)64.23
13Gemini 3.1 Flash Lite (Preview)63.98
14Qwen 3 14B (Non-reasoning)63.73
15Gemini 2.5 Flash (Non-reasoning)62.61

Interactive version: theaggregate.ai/benchmark?slug=euroeval-catalan-nlu · How the rankings work · Data refreshed daily, snapshot 2026-07-22.