EuroEval Polish Common Sense Reasoning: leaderboard

Metric: Common Sense Reasoning Average Score (%). Source: euroeval.com. 216 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)80.96
2GPT-579.47
3Gemini 3 Pro (Preview)73.13
4GPT-5 Mini69.61
5Qwen 3 Next 80B A3B (Thinking)69.07
6Gemini 2.5 Flash (Thinking)68.95
7Gemini 2.5 Pro68.48
8Gemma 4 31B (IT)67.78
9Claude Sonnet 4.5 (Non-reasoning)64.71
10Qwen 3 235B A22B 2507 Instruct64.64
11GPT-5.4 Mini (High)62.13
12Gemini 3.1 Flash Lite (Preview)61.15
13Qwen 3 30B A3B60.73
14Qwen 2.5 72B Instruct60.05
15Llama 3.3 70B Instruct59.3

Interactive version: theaggregate.ai/benchmark?slug=euroeval-polish-common-sense-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.