Llama-PLLuM-70B-chat: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1556 ± 23, rank #813 of 2656 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Polish EQ-Bench72.99EQ-Bench Score93.1
LLMZSZL Leaderboard64.42Score91.8
MT-Bench PL - Extraction9.45Judge Score (0-10)77.6
MT-Bench PL - Writing8.05Judge Score (0-10)57.1
CPTU Bench3.53Average Score (1-5)53.5
MT-Bench PL - Overall6.75Judge Score (0-10)51
MT-Bench PL - Reasoning5.2Judge Score (0-10)45.9
MT-Bench PL - Coding4.8Judge Score (0-10)44.9
PLCC - Culture & Tradition64Accuracy (%)44.7
PLCC - History74Accuracy (%)44.2
MT-Bench PL - STEM8.2Judge Score (0-10)39.8
MT-Bench PL - Humanities8.8Judge Score (0-10)38.8

Interactive version: theaggregate.ai/model?slug=llama-pllum-70b-chat · How It Works · Data refreshed daily, snapshot 2026-09-19.