O3 (Low): benchmark results
O3 evaluated at the low reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.
Unified ELO 1617 ± 1, rank #367 of 1761 rated models, from 14 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| UGI - Natural Intelligence | 65.53 | NatInt Score | 96.2 |
| UGI - Writing | 65.79 | Writing Score | 96.1 |
| UGI Leaderboard | 52.09 | UGI Score | 93.2 |
| LLM Chess (Saplin) | 738.6 | ELO | 80.7 |
| Chess Puzzles (Epoch AI) | 27 | Accuracy (%) | 76.3 |
| DROP | 82.3 | F1 Score | 63.3 |
| OTIS Mock AIME 2024-25 | 60 | Accuracy (%) | 45.5 |
| FrontierMath - Tiers 1-3 | 9.72 | Accuracy (%, 290 problems) | 44.4 |
| ARC-AGI-1 | 41.5 | Accuracy (%) | 35.9 |
| FrontierMath - Tiers 1-3 (v2) | 19.3 | Accuracy (%, 285 private v2 problems) | 31.5 |
| ARC-AGI-2 | 1.99 | Accuracy (%) | 25.7 |
| UGI - Willingness (W/10) | 2.2 | W/10 Score | 15.4 |
Interactive version: theaggregate.ai/model?slug=o3-low · How It Works · Data refreshed daily, snapshot 2026-09-05.