Llama 3.3 70B: benchmark results

Meta's open Llama 3.3 70B dense instruction model, delivering near-405B quality at 70B (December 2024). Provider: Meta. Released 2024-12-06. Access: Open.

Unified ELO 1539 ± 1, rank #486 of 1392 rated models, from 111 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
DiagFlowBench85Step Accuracy (self-reported)100
Medical Information Response Audit (MIRA)2.95Underinformative simplification (D3) (self-reported)100
NoLiMa97.3Base Score (%)95.2
TextClass Benchmark1746.41Meta-Elo (self-reported)92.5
EHRBench67.28Overall Acc (%) (self-reported)90
SuiChat-CN71.6Standard F1 (self-reported)86
CommonWhy21.4BS-Prec (Long-Tail) (self-reported)83.3
When Context Flips, Safety Breaks38PacifAIst BSR (self-reported)81.8
ASCIIEval32.74Macro-Avg Accuracy (%)80.6
Divergent Thinking4.44Divergence Score77.8
PhysicsFinals31.5Score (self-reported)71.9
POLAR-Bench86.23Overall Mean (self-reported)71.4

Interactive version: theaggregate.ai/model?slug=llama-3-3-70b · How It Works · Data refreshed daily, snapshot 2026-09-05.