CPTU Bench: leaderboard

Polish language comprehension benchmark: evaluates LLMs on sentiment analysis, language understanding, phraseology, and tricky questions in Polish.

Metric: Average Score (1-5). Source: huggingface.co. Status: saturation imminent. 102 models tracked.

Top models

#ModelScore
1Qwen 3.6 27B (Reasoning)4.41
2Qwen 3.5 122B A10B (Reasoning)4.36
3Gemini 2.0 Flash (001)4.29
4Qwen 3.6 27B (Non-reasoning)4.29
5Qwen 3.5 122B A10B (Non-reasoning)4.26
6Gemma 4 26B A4B (IT) (Reasoning)4.21
7DeepSeek V3.24.14
8DeepSeek R14.14
9Gemini 2.0 Flash Lite (001)4.09
10DeepSeek V3.14.03
11DeepSeek V3 (0324)4.03
12DeepSeek V34.02
13Mistral Large 2 (Nov) Instruct (2411)4
14Kimi K2 09053.98
15Qwen 2.5 72B Instruct3.95

Interactive version: theaggregate.ai/benchmark?slug=cptu-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.