EuroEval Lithuanian NLU - ScaLA LT — leaderboard

Metric: Linguistic acceptability Score (%). Source: euroeval.com. 230 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)64.96
2Gemini 3 Flash (Preview) (Non-reasoning)60.29
3Claude Sonnet 4.659.11
4GPT-556.77
5GPT-5.4 Mini (High)53.61
6Gemini 3.1 Flash Lite (Preview)52.41
7Gemini 2.5 Pro51.54
8Claude 3.5 Haiku (20241022)50.62
9GPT-5 Mini49.84
10Qwen 3 235B A22B 2507 Instruct47.37
11GPT-5.4 Mini (Non-reasoning)46.72
12GPT-4.146.15
13Gemini 2.5 Flash (Thinking)45.05
14GPT-5.4 Nano (Medium)44.97
15GPT-5.4 Mini (Medium)44.22

Interactive version: theaggregate.ai/benchmark?slug=euroeval-lithuanian-nlu-scala-lt · How the rankings work · Data refreshed daily, snapshot 2026-07-22.