O3 (High) — benchmark results
O3 evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.
Unified ELO 1800 ± 17, rank #141 of 1776 rated models, from 72 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Ducky Bench (Saxo Frog) | 1449 | ELO | 100 |
| LLM2014 Logic 2025-04 | 85.85 | Median Score | 100 |
| LLM2014 Logic 2025-05 | 85.14 | Median Score | 100 |
| LLM2014 Logic 2025-06 | 83.95 | Median Score | 100 |
| OpenAI GPT-5 System Card - Human Pathogen Capabilities Test | 58.3 | Mean Accuracy (%) | 100 |
| OpenAI GPT-5 System Card - MMLU Language Arabic | 0.9 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language French | 0.91 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language German | 0.91 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Italian | 0.91 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Spanish | 0.91 | Accuracy | 100 |
| OpenAI GPT-5 System Card - Virology Capabilities Test | 42 | Mean Accuracy (%) | 100 |
| ResearchCodeBench | 59.4 | Task Success Rate (%) | 96.8 |
Interactive version: theaggregate.ai/model?slug=o3-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.