EuroEval Polish NLU - ScaLA PL — leaderboard

Metric: Linguistic acceptability Score (%). Source: euroeval.com. 234 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)71.7
2Gemini 3 Flash (Preview) (Non-reasoning)69.86
3Gemini 3.1 Flash Lite (Preview)67.21
4Gemini 2.5 Flash (Thinking)65.39
5GPT-5.4 Mini (Non-reasoning)64.24
6GPT-5.4 Mini (Medium)64.15
7Claude Sonnet 4.661.86
8GPT-5.261.36
9GPT-5.4 Mini (High)60.74
10GPT-559.8
11Gemma 4 31B (IT)59.77
12Gemini 2.5 Pro59.32
13Claude Sonnet 4.5 (Thinking)56.9
14Gemini 2.5 Flash Lite (Thinking)56.05
15GPT-5.4 Nano (High)55.49

Interactive version: theaggregate.ai/benchmark?slug=euroeval-polish-nlu-scala-pl · How the rankings work · Data refreshed daily, snapshot 2026-07-22.