PULI-LlumiX-32K: benchmark results
Provider: Other. Access: Open.
Unified ELO 1328 ± 19, rank #2591 of 2928 rated models, from 12 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 39.64 | Score | 39 |
| Open LLM Leaderboard v1 - HellaSwag | 75 | Normalized accuracy (%) (10-shot) | 25.6 |
| Open LLM Leaderboard v1 - GSM8K | 6.07 | Accuracy (%) (5-shot) | 25.1 |
| Open LLM Leaderboard v1 - ARC Challenge | 48.63 | Normalized accuracy (%) (25-shot) | 23.4 |
| Open LLM Leaderboard v1 - WinoGrande | 68.03 | Accuracy (%) (5-shot) | 22.2 |
| Open LLM Leaderboard v1 - MMLU | 41.65 | Accuracy (%) (5-shot) | 21.8 |
| Open LLM Leaderboard - MMLU-Pro | 16.81 | Score | 17.9 |
| Open LLM Leaderboard - BBH | 31.89 | Score | 11.3 |
| Open LLM Leaderboard - MATH Level 5 | 1.28 | Score | 9.2 |
| Open LLM Leaderboard - IFEval | 17 | Score | 7.9 |
| Open LLM Leaderboard - GPQA | 25.34 | Score | 6.9 |
| Open LLM Leaderboard v1 - TruthfulQA MC2 | 36.93 | MC2 (%) (0-shot) | 4.6 |
Interactive version: theaggregate.ai/model?slug=puli-llumix-32k · How It Works · Data refreshed daily, snapshot 2026-09-23.