PLLuM-12B-chat — benchmark results
Provider: PLLuM. Released 2025-02-24. Access: Open.
Unified ELO 1294 ± 45, rank #1543 of 1776 rated models, from 25 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 14.67 | Score | 79.7 |
| LLMZSZL Leaderboard | 49.69 | Score | 62.2 |
| Polish EQ-Bench | 57.29 | EQ-Bench Score | 59.4 |
| MT-Bench PL - Writing | 8 | Judge Score (0-10) | 55.1 |
| MT-Bench PL - Humanities | 9.3 | Judge Score (0-10) | 52 |
| CPTU Bench | 3.14 | Average Score (1-5) | 42.4 |
| MT-Bench PL - STEM | 8 | Judge Score (0-10) | 36.7 |
| Open LLM Leaderboard - MMLU-Pro | 20.8 | Score | 32.7 |
| Open LLM Leaderboard - BBH | 21.32 | Score | 31.8 |
| MT-Bench PL - Overall | 5.81 | Judge Score (0-10) | 30.6 |
| Open LLM Leaderboard - IFEval | 32.14 | Score | 29.8 |
| MT-Bench PL - Reasoning | 3.9 | Judge Score (0-10) | 28.6 |
Interactive version: theaggregate.ai/model?slug=pllum-12b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.