EuroEval Catalan Common Sense Reasoning — leaderboard

Metric: Common Sense Reasoning Average Score (%). Source: euroeval.com. 194 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)77.83
2Gemini 3 Pro (Preview)77.76
3GPT-577.01
4Gemini 2.5 Flash (Thinking)70.94
5Grok 4.20 Beta (0309) (Reasoning)70.28
6Gemini 2.5 Pro66.44
7Claude Sonnet 4.5 (Non-reasoning)65.98
8Gemini 3 Flash (Preview) (Non-reasoning)63.04
9GPT-5 Mini61.19
10Gemma 4 31B (IT)60.12
11GPT-5.4 Mini (High)58.95
12GPT-5.4 Mini (Medium)58.52
13Qwen 3.5 9B56.89
14Grok 4.1 Fast (Reasoning)56.57
15Qwen 3.5 4B55.1

Interactive version: theaggregate.ai/benchmark?slug=euroeval-catalan-common-sense-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.