Llama-PLLuM-8B-chat — benchmark results

Provider: Meta. Released 2025-02-24. Access: Open.

Unified ELO 1334 ± 22, rank #1463 of 1776 rated models, from 18 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MT-Bench PL - Humanities9.5Judge Score (0-10)67.3
Open LLM Leaderboard - MuSR11.86Score63.9
LLMZSZL Leaderboard47.68Score59.2
MT-Bench PL - Reasoning5.35Judge Score (0-10)49
Polish EQ-Bench50.97EQ-Bench Score45.5
MT-Bench PL - Overall6.05Judge Score (0-10)35.7
Open LLM Leaderboard - IFEval35.15Score33.6
MT-Bench PL - STEM7.5Judge Score (0-10)32.7
MT-Bench PL - Writing7.2Judge Score (0-10)32.7
Open LLM Leaderboard - MMLU-Pro19.1Score29.2
CPTU Bench2.92Average Score (1-5)28.3
Open LLM Leaderboard - BBH16.28Score24.7

Interactive version: theaggregate.ai/model?slug=llama-pllum-8b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.