EuroEval Polish NLU - ScaLA PL: leaderboard

Metric: Linguistic acceptability Score (%). Source: euroeval.com. 234 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)71.7
2Gemini 3.1 Flash Lite (Preview)67.21
3Gemini 2.5 Flash (Thinking)65.39
4GPT-5.4 Mini (Medium)64.15
5Claude Sonnet 4.661.86
6GPT-5.261.36
7GPT-5.4 Mini (High)60.74
8GPT-559.8
9Gemma 4 31B (IT)59.77
10Gemini 2.5 Pro59.32
11Claude Sonnet 4.5 (Thinking)56.9
12GPT-5.4 Nano (High)55.49
13Gemma 4 26B A4B (IT)55.07
14GPT-5 Nano54.8
15Grok 4.1 Fast (Reasoning)54.51

Interactive version: theaggregate.ai/benchmark?slug=euroeval-polish-nlu-scala-pl · How It Works · Data refreshed daily, snapshot 2026-09-05.