EuroEval Catalan Common Sense Reasoning: leaderboard

Metric: Common Sense Reasoning Average Score (%). Source: euroeval.com. 194 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)77.83
2Gemini 3 Pro (Preview)77.76
3GPT-577.01
4Gemini 2.5 Flash (Thinking)70.94
5Grok 4.20 Beta (0309) (Reasoning)70.28
6Gemini 2.5 Pro66.44
7Claude Sonnet 4.5 (Non-reasoning)65.98
8GPT-5 Mini61.19
9Gemma 4 31B (IT)60.12
10GPT-5.4 Mini (High)58.95
11GPT-5.4 Mini (Medium)58.52
12Qwen 3.5 9B56.89
13Grok 4.1 Fast (Reasoning)56.57
14Qwen 3.5 4B55.1
15Llama 3.3 70B Instruct54.47

Interactive version: theaggregate.ai/benchmark?slug=euroeval-catalan-common-sense-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.