O3 (2025-04-16) (Medium): benchmark results
O3 (2025-04-16) evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.
Unified ELO 1658 ± 1, rank #217 of 1761 rated models, from 14 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Fiction.LiveBench | 100 | Accuracy (%) | 100 |
| UGI - Writing | 66.83 | Writing Score | 96.6 |
| UGI - Natural Intelligence | 65.92 | NatInt Score | 96.3 |
| Chess Puzzles (Epoch AI) | 38 | Accuracy (%) | 86.5 |
| UGI Leaderboard | 47.45 | UGI Score | 84.9 |
| VPCT | 52 | Accuracy (%) | 71.8 |
| OTIS Mock AIME 2024-25 | 84.44 | Accuracy (%) | 70 |
| Epoch AI - Mystery Game Puzzles | 23 | Score | 68.1 |
| SEAL - MultiNRC | 44.45 | Score | 65.1 |
| Wolfram LLM Benchmarking Project | 47.4 | Correct Functionality (%) | 62.9 |
| SEAL - TutorBench | 52.76 | Score | 53.8 |
| FrontierMath - Tiers 1-3 (v2) | 29.82 | Accuracy (%, 285 private v2 problems) | 47.6 |
Interactive version: theaggregate.ai/model?slug=o3-2025-04-16-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.