Llama 3.3 70B: benchmark results
Meta's open Llama 3.3 70B dense instruction model, delivering near-405B quality at 70B (December 2024). Provider: Meta. Released 2024-12-06. Access: Open.
Unified ELO 1539 ± 1, rank #486 of 1392 rated models, from 111 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| DiagFlowBench | 85 | Step Accuracy (self-reported) | 100 |
| Medical Information Response Audit (MIRA) | 2.95 | Underinformative simplification (D3) (self-reported) | 100 |
| NoLiMa | 97.3 | Base Score (%) | 95.2 |
| TextClass Benchmark | 1746.41 | Meta-Elo (self-reported) | 92.5 |
| EHRBench | 67.28 | Overall Acc (%) (self-reported) | 90 |
| SuiChat-CN | 71.6 | Standard F1 (self-reported) | 86 |
| CommonWhy | 21.4 | BS-Prec (Long-Tail) (self-reported) | 83.3 |
| When Context Flips, Safety Breaks | 38 | PacifAIst BSR (self-reported) | 81.8 |
| ASCIIEval | 32.74 | Macro-Avg Accuracy (%) | 80.6 |
| Divergent Thinking | 4.44 | Divergence Score | 77.8 |
| PhysicsFinals | 31.5 | Score (self-reported) | 71.9 |
| POLAR-Bench | 86.23 | Overall Mean (self-reported) | 71.4 |
Interactive version: theaggregate.ai/model?slug=llama-3-3-70b · How It Works · Data refreshed daily, snapshot 2026-09-05.