LLMZSZL Leaderboard — leaderboard

Polish-language LLM leaderboard comparing open and proprietary models on Polish zero-shot and language-understanding tasks.

Metric: Score. Source: huggingface.co. Status: saturation imminent. 99 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct69.06
2Qwen 2.5 72B68.5
3Mistral Large 2 (Jul)67.17
4Llama 3.3 70B Instruct67.13
5Qwen 3 32B66.84
6Mistral Large 2 (Nov) Instruct (2411)66.61
7Llama 3.1 70B Instruct66.59
8Llama 3 70B Instruct64.04
9Qwen 3 30B A3B63.52
10Llama 3.1 70B63.12
11Llama 3 70B62.22
12Qwen 2.5 32B61.04
13Qwen 3 14B61.02
14Mixtral 8x22B Instruct (v0.1)58.17
15Bielik-11B-v2.1-Instruct57.52

Interactive version: theaggregate.ai/benchmark?slug=llmzszl-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.