Open PL LLM - PolEmo2-IN (multiple choice, 5-shot): leaderboard
Metric: Accuracy (%). Source: huggingface.co. 324 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Mistral Large 2 (Jul) | 91.69 |
| 2 | Mistral Large 2 (Nov) Instruct (2411) | 89.47 |
| 3 | Bielik-11B-v2.0-Instruct | 88.78 |
| 4 | Llama 4 Scout Instruct | 87.95 |
| 5 | Qwen 2 72B Instruct | 87.53 |
| 6 | Qwen 2.5 72B Instruct | 87.4 |
| 7 | Bielik-11B-v2.3-Instruct | 87.4 |
| 8 | Bielik-11B-v2.2-Instruct | 87.26 |
| 9 | Qwen 2.5 14B Instruct | 87.12 |
| 10 | Bielik-11B-v2.1-Instruct | 87.12 |
| 11 | Llama 3.1 405B Instruct FP8 | 86.98 |
| 12 | Qwen 3 8B | 86.84 |
| 13 | MSH-v1-Bielik-v2.3-Instruct-MedIT-merge | 86.84 |
| 14 | Qwen 3 30B A3B 2507 Instruct | 86.57 |
| 15 | Phi-4 | 86.29 |
Interactive version: theaggregate.ai/benchmark?slug=open-pl-llm-polemo2-in-multiple-choice-5-shot · How It Works · Data refreshed daily, snapshot 2026-09-19.