OLMo 2 13B Instruct November 2024 — benchmark results

Provider: Allen AI. Released 2024-11-26. Access: Open.

Unified ELO 1337 ± 32, rank #1450 of 1776 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety XSTest92.6LM Evaluated Safety score (%)19.2
HELM Capabilities - WildBench68.91WB Score16
HELM Safety HarmBench51.9LM Evaluated Safety score (%)15.1
HELM Capabilities - GPQA31.61COT correct14
HELM Capabilities - IFEval72.98IFEval Strict Acc12
HELM Capabilities - Omni-MATH15.57Acc11
HELM Safety BBQ70.4BBQ accuracy (%)9.3
HELM Capabilities - MMLU-Pro31COT correct8
HELM Safety77.3Mean score (self-reported)5.8
HELM Safety Anthropic Red Team90.7LM Evaluated Safety score (%)5.8
HELM Safety SimpleSafetyTests81LM Evaluated Safety score (%)5.2

Interactive version: theaggregate.ai/model?slug=olmo-2-13b-instruct-november-2024 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.