OLMo 3 32B (Thinking): benchmark results

OLMo 3 32B evaluated with thinking enabled. Provider: Allen AI. Released 2025-11-20. Access: Open.

Unified ELO 1477 ± 1, rank #984 of 1761 rated models, from 82 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Medmarks - SCTpublic67.64Score (%)78.6
Medmarks - Med-HALT Reasoning NOTA63.53Score (%)72.9
AA AIME 202573.67Accuracy (%)66.6
Medmarks - Med-HALT Reasoning FCT71.67Score (%)65.7
AA LiveCodeBench67.2Pass@1 (%)65
Medmarks - PubHealthBench Reviewed84.04Score (%)58.6
AA IFBench49.12Accuracy (%)58.4
Medmarks - LongHealth Task 186.5Score (%)55.7
Medmarks - MetaMedQA65.36Score (%)55.7
Medmarks - MedXpertQA Understanding22.18Score (%)52.1
Medmarks - SuperGPQA Medicine Hard34.25Score (%)50
Medmarks - MedConceptsQA Hard50.13Score (%)49.3

Interactive version: theaggregate.ai/model?slug=olmo-3-32b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.