Open PL LLM - PPC (generative, 5-shot): leaderboard
Metric: Accuracy (%). Source: huggingface.co. 320 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Qwen 2.5 32B | 83.6 |
| 2 | Llama 3.1 405B Instruct FP8 | 82.5 |
| 3 | QwQ 32B-Preview | 82.2 |
| 4 | Qwen 2.5 72B Instruct | 81.8 |
| 5 | QwQ-32B | 81.5 |
| 6 | Qwen 2.5 14B | 81.5 |
| 7 | Qwen 2 72B | 81.4 |
| 8 | Qwen 2 72B Instruct | 81.1 |
| 9 | Qwen 2.5 72B | 81.1 |
| 10 | aya-expanse-32B | 80.8 |
| 11 | Qwen 2.5 32B Instruct | 80.6 |
| 12 | Llama 3.3 70B Instruct | 79.9 |
| 13 | Qwen 3 30B A3B | 79.6 |
| 14 | MSH-v1-Bielik-v2.3-Instruct-MedIT-merge | 79.5 |
| 15 | Bielik-11B-v2.1-Instruct | 79.3 |
Interactive version: theaggregate.ai/benchmark?slug=open-pl-llm-ppc-generative-5-shot · How It Works · Data refreshed daily, snapshot 2026-09-19.