O3 — benchmark results
OpenAI's o-series o3 reasoning model for difficult multi-step tasks. Provider: OpenAI. Released 2025-04-16. Access: API.
Unified ELO 1778 ± 13, rank #164 of 1776 rated models, from 293 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Beyond Continuity | 97.7 | F1 Pivot (TopiOCQA) (self-reported) | 100 |
| CadEval | 74 | Score (self-reported) | 100 |
| CodeClash - Halite | 1577 | ELO | 100 |
| FinanceArena | 54.1 | Overall Accuracy (self-reported) | 100 |
| HealthBench | 60 | Score (%) | 100 |
| ImplicitQA (Average Accuracy) | 64.1 | Average Accuracy | 100 |
| ImplicitQA (Macro Average Accuracy) | 68.6 | Macro Average Accuracy | 100 |
| MMTU - Column Relationship | 68.71 | Accuracy (%) | 100 |
| MMTU - KB mapping | 61.44 | Accuracy (%) | 100 |
| Mizan LLM Leaderboard | 74.7 | Average Score (0-100) | 100 |
| MoNaCo | 61.18 | F1 | 100 |
| OdysseyBench | 56.19 | Overall (Old) (self-reported) | 100 |
Interactive version: theaggregate.ai/model?slug=o3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.