OLMo 2 7B Instruct November 2024 — benchmark results

Provider: Allen AI. Released 2024-11-26. Access: Open.

Unified ELO 1294 ± 34, rank #1544 of 1776 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety HarmBench57.8LM Evaluated Safety score (%)23.3
HELM Safety XSTest88.8LM Evaluated Safety score (%)10.5
HELM Capabilities - GPQA29.6COT correct9
HELM Capabilities - IFEval69.29IFEval Strict Acc8
HELM Capabilities - MMLU-Pro29.2COT correct6
HELM Capabilities - Omni-MATH11.63Acc6
HELM Capabilities - WildBench62.84WB Score4
HELM Safety SimpleSafetyTests77.5LM Evaluated Safety score (%)3.5
HELM Safety72.9Mean score (self-reported)3.3
HELM Safety Anthropic Red Team88LM Evaluated Safety score (%)2.3
HELM Safety BBQ52.5BBQ accuracy (%)1.2

Interactive version: theaggregate.ai/model?slug=olmo-2-7b-instruct-november-2024 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.