O3 — benchmark results

OpenAI's o-series o3 reasoning model for difficult multi-step tasks. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1778 ± 13, rank #164 of 1776 rated models, from 293 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Beyond Continuity97.7F1 Pivot (TopiOCQA) (self-reported)100
CadEval74Score (self-reported)100
CodeClash - Halite1577ELO100
FinanceArena54.1Overall Accuracy (self-reported)100
HealthBench60Score (%)100
ImplicitQA (Average Accuracy)64.1Average Accuracy100
ImplicitQA (Macro Average Accuracy)68.6Macro Average Accuracy100
MMTU - Column Relationship68.71Accuracy (%)100
MMTU - KB mapping61.44Accuracy (%)100
Mizan LLM Leaderboard74.7Average Score (0-100)100
MoNaCo61.18F1100
OdysseyBench56.19Overall (Old) (self-reported)100

Interactive version: theaggregate.ai/model?slug=o3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.