Palmyra X V3 (72B) — benchmark results

Writer's 72B enterprise API model, the top non-OpenAI performer on Stanford's HELM Lite leaderboard at its debut. Provider: Writer. Released 2024-01-01. Access: API.

Unified ELO 1458 ± 45, rank #962 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM WMT 201426.19BLEU-4 (%)100
HELM v2 Lite - LegalBench70.66Exact Match (%)95
HELM v2 Lite - MedQA76.92Exact Match (%)87.5
HELM Lite72.34Mean win rate (self-reported)79.2
HELM (Stanford)67.92Mean Win Rate (%)72.2
HELM NaturalQuestions (Closed)40.72F1 (%)65.6
HELM NaturalQuestions (Open)68.52F1 (%)41.1
HELM NarrativeQA70.59F1 (%)31.1
HELM v2 Lite - HumanEval (Code)2Pass@1 (%)29.4

Interactive version: theaggregate.ai/model?slug=palmyra-x-v3-72b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.