EuroEval Catalan NLU - ScaLA CA: leaderboard

Metric: Linguistic acceptability Score (%). Source: euroeval.com. 212 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)71.6
2GPT-5.271.59
3Claude Sonnet 4.668.77
4Gemini 3.1 Flash Lite (Preview)64.19
5Gemini 2.5 Flash (Thinking)63.33
6GPT-4.162.88
7Gemini 2.5 Pro61.38
8Qwen 2.5 72B Instruct58.66
9Qwen 3 30B A3B 2507 Instruct54.92
10GPT-4.1 Mini54.78
11Claude Sonnet 4.5 (Thinking)52.35
12GPT-5.4 Mini (High)51.68
13GPT-5.4 Mini (Medium)49.63
14Grok 4.20 Beta (0309) (Reasoning)47.57
15Ministral-3-3B-Instruct-251245.23

Interactive version: theaggregate.ai/benchmark?slug=euroeval-catalan-nlu-scala-ca · How It Works · Data refreshed daily, snapshot 2026-09-05.