O3: benchmark results
OpenAI's o-series o3 reasoning model for difficult multi-step tasks. Provider: OpenAI. Released 2025-04-16. Access: API.
Unified ELO 1672 ± 1, rank #92 of 1392 rated models, from 313 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Beyond Continuity | 97.7 | F1 Pivot (TopiOCQA) (self-reported) | 100 |
| CadEval | 74 | Score (self-reported) | 100 |
| CodeClash - Halite | 1577 | ELO | 100 |
| FinanceArena | 54.1 | Overall Accuracy (self-reported) | 100 |
| HealthBench | 60 | Score (%) | 100 |
| ImplicitQA (Average Accuracy) | 64.1 | Average Accuracy | 100 |
| ImplicitQA (Macro Average Accuracy) | 68.6 | Macro Average Accuracy | 100 |
| MMTU - Column Relationship | 68.71 | Accuracy (%) | 100 |
| MMTU - KB mapping | 61.44 | Accuracy (%) | 100 |
| Mizan LLM Leaderboard | 74.7 | Average Score (0-100) | 100 |
| MoNaCo | 61.18 | F1 | 100 |
| OdysseyBench | 56.19 | Overall (Old) (self-reported) | 100 |
Interactive version: theaggregate.ai/model?slug=o3 · How It Works · Data refreshed daily, snapshot 2026-09-05.