O3 Pro — benchmark results

OpenAI's pro-tier o-series reasoning model for difficult multi-step tasks. Provider: OpenAI. Released 2025-06-10. Access: API.

Unified ELO 1757 ± 25, rank #183 of 1776 rated models, from 18 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
TrackingAI IQ Test (Mensa Norway)94.29Mensa Norway Score (%)93.9
Merge-Bench46.1Equivalent text (self-reported)88.2
SEAL - Professional Reasoning Benchmark - Legal49.67Score85.7
TrackingAI IQ Test90.2IQ Test Score (%)85
Kagi LLM Benchmark72.1Accuracy (%)84.3
AA GPQA Diamond84.55Accuracy (%)82.6
SEAL - Professional Reasoning Benchmark - Finance49.08Score82.1
TutorBench54.62Score (self-reported)81.8
Artificial Analysis Intelligence Index32.52Intelligence Index79.2
Ducky Bench (Saxo Frog)1158ELO70.8
TrackingAI IQ Test (Offline)68.75Offline IQ Score (%)66.2
NarrativeWorldBench79Plot-Beat F1 (h=50) (self-reported)61.1

Interactive version: theaggregate.ai/model?slug=o3-pro · How the rankings work · Data refreshed daily, snapshot 2026-07-22.