OLMo 2 13B Instruct November 2024 — benchmark results
Provider: Allen AI. Released 2024-11-26. Access: Open.
Unified ELO 1337 ± 32, rank #1450 of 1776 rated models, from 11 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM Safety XSTest | 92.6 | LM Evaluated Safety score (%) | 19.2 |
| HELM Capabilities - WildBench | 68.91 | WB Score | 16 |
| HELM Safety HarmBench | 51.9 | LM Evaluated Safety score (%) | 15.1 |
| HELM Capabilities - GPQA | 31.61 | COT correct | 14 |
| HELM Capabilities - IFEval | 72.98 | IFEval Strict Acc | 12 |
| HELM Capabilities - Omni-MATH | 15.57 | Acc | 11 |
| HELM Safety BBQ | 70.4 | BBQ accuracy (%) | 9.3 |
| HELM Capabilities - MMLU-Pro | 31 | COT correct | 8 |
| HELM Safety | 77.3 | Mean score (self-reported) | 5.8 |
| HELM Safety Anthropic Red Team | 90.7 | LM Evaluated Safety score (%) | 5.8 |
| HELM Safety SimpleSafetyTests | 81 | LM Evaluated Safety score (%) | 5.2 |
Interactive version: theaggregate.ai/model?slug=olmo-2-13b-instruct-november-2024 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.