OLMo 2 7B Instruct November 2024: benchmark results

Provider: Allen AI. Released 2024-11-26. Access: Open.

Unified ELO 1363 ± 1, rank #1237 of 1392 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety HarmBench57.8LM Evaluated Safety score (%)23.3
HELM Safety XSTest88.8LM Evaluated Safety score (%)10.5
HELM Capabilities - GPQA29.6COT correct9
HELM Capabilities - IFEval69.29IFEval Strict Acc8
HELM Capabilities - MMLU-Pro29.2COT correct6
HELM Capabilities - Omni-MATH11.63Acc6
HELM Capabilities - WildBench62.84WB Score4
HELM Safety72.9Mean score (self-reported)4
HELM Safety SimpleSafetyTests77.5LM Evaluated Safety score (%)3.5
HELM Safety Anthropic Red Team88LM Evaluated Safety score (%)2.3
HELM Safety BBQ52.5BBQ accuracy (%)1.2

Interactive version: theaggregate.ai/model?slug=olmo-2-7b-instruct-november-2024 · How It Works · Data refreshed daily, snapshot 2026-09-05.