O3 (Medium) — benchmark results

O3 evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1791 ± 32, rank #149 of 1776 rated models, from 35 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Gapminder AI Worldview93.9Correct Rate (%)100
HAL AssistantBench38.81Accuracy (%)100
HAL ScienceAgentBench33.33Accuracy (%)100
Step Game (Lechmazur)5.32TrueSkill μ98.6
HAL SciCode9.23Accuracy (%)96.7
SEAL - EnigmaEval13.09Score91.9
IneqMath37Overall Accuracy (self-reported)90.2
NYT Connections Older Models73Score (%)89.8
LLM Chess (Saplin)777.6ELO89.3
LisanBench0.23Mean Path Length / Current Maximum87.9
EnigmaEval13.09Score (self-reported)86.8
HAL TAU-bench Airline54Accuracy (%)82.1

Interactive version: theaggregate.ai/model?slug=o3-medium · How the rankings work · Data refreshed daily, snapshot 2026-07-22.