EuroEval Catalan NLU - ScaLA CA — leaderboard

Metric: Linguistic acceptability Score (%). Source: euroeval.com. 212 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)71.6
2GPT-5.271.59
3Claude Sonnet 4.668.77
4Gemini 3 Flash (Preview) (Non-reasoning)66.37
5Gemini 3.1 Flash Lite (Preview)64.19
6Gemini 2.5 Flash (Thinking)63.33
7GPT-5.4 Mini (Non-reasoning)63.09
8GPT-4.162.88
9Gemini 2.5 Pro61.38
10Qwen 2.5 72B Instruct58.66
11Gemini 2.5 Flash Lite (Thinking)57.82
12Qwen 3 30B A3B 2507 Instruct54.92
13GPT-4.1 Mini54.78
14Qwen 3 14B (Non-reasoning)54.6
15Gemini 2.5 Flash (Non-reasoning)53.59

Interactive version: theaggregate.ai/benchmark?slug=euroeval-catalan-nlu-scala-ca · How the rankings work · Data refreshed daily, snapshot 2026-07-22.