PLLuM-12B-chat: benchmark results
Provider: PLLuM. Released 2025-02-24. Access: Open.
Unified ELO 1397 ± 1, rank #1148 of 1392 rated models, from 25 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 14.67 | Score | 79.7 |
| LLMZSZL Leaderboard | 49.69 | Score | 62.2 |
| Polish EQ-Bench | 57.29 | EQ-Bench Score | 59.4 |
| MT-Bench PL - Writing | 8 | Judge Score (0-10) | 55.1 |
| MT-Bench PL - Humanities | 9.3 | Judge Score (0-10) | 52 |
| CPTU Bench | 3.14 | Average Score (1-5) | 38.6 |
| MT-Bench PL - STEM | 8 | Judge Score (0-10) | 36.7 |
| Open LLM Leaderboard - MMLU-Pro | 20.8 | Score | 32.7 |
| Open LLM Leaderboard - BBH | 21.32 | Score | 31.8 |
| MT-Bench PL - Overall | 5.81 | Judge Score (0-10) | 30.6 |
| Open LLM Leaderboard - IFEval | 32.14 | Score | 29.8 |
| MT-Bench PL - Reasoning | 3.9 | Judge Score (0-10) | 28.6 |
Interactive version: theaggregate.ai/model?slug=pllum-12b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.