Palmyra Med — benchmark results

Writer's 70B medical-domain specialist tuned on biomedical data, released July 2024 alongside Palmyra Fin. Provider: Writer. Released 2024-07-30. Access: API.

Unified ELO 1429 ± 23, rank #1089 of 1776 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety XSTest96.3LM Evaluated Safety score (%)55.8
HELM Safety SimpleSafetyTests98.5LM Evaluated Safety score (%)46.5
HELM AIR-Bench57.8Refusal Rate (%)31.4
HELM Safety Anthropic Red Team97.8LM Evaluated Safety score (%)27.9
HELM Capabilities - GPQA36.77COT correct23
HELM Capabilities - IFEval76.74IFEval Strict Acc22
HELM Safety85.7Mean score (self-reported)21.5
HELM Safety BBQ80.1BBQ accuracy (%)19.8
HELM Safety HarmBench55.6LM Evaluated Safety score (%)18.6
HELM Capabilities - MMLU-Pro41.1COT correct14
HELM Capabilities - WildBench67.58WB Score12
HELM Capabilities - Omni-MATH15.57Acc11

Interactive version: theaggregate.ai/model?slug=palmyra-med · How the rankings work · Data refreshed daily, snapshot 2026-07-22.