EuroEval Polish Common Sense Reasoning — leaderboard

Metric: Common Sense Reasoning Average Score (%). Source: euroeval.com. 216 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)80.96
2GPT-579.47
3Gemini 3 Pro (Preview)73.13
4GPT-5 Mini69.61
5Qwen 3 Next 80B A3B (Thinking)69.07
6Gemini 2.5 Flash (Thinking)68.95
7Gemini 2.5 Pro68.48
8Gemma 4 31B (IT)67.78
9Gemini 3 Flash (Preview) (Non-reasoning)65.23
10Claude Sonnet 4.5 (Non-reasoning)64.71
11Qwen 3 235B A22B 2507 Instruct64.64
12GPT-5.4 Mini (High)62.13
13Gemini 3.1 Flash Lite (Preview)61.15
14Qwen 3 30B A3B60.73
15Qwen 2.5 72B Instruct60.05

Interactive version: theaggregate.ai/benchmark?slug=euroeval-polish-common-sense-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.