O3 (High) — benchmark results

O3 evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1800 ± 17, rank #141 of 1776 rated models, from 72 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Ducky Bench (Saxo Frog)1449ELO100
LLM2014 Logic 2025-0485.85Median Score100
LLM2014 Logic 2025-0585.14Median Score100
LLM2014 Logic 2025-0683.95Median Score100
OpenAI GPT-5 System Card - Human Pathogen Capabilities Test58.3Mean Accuracy (%)100
OpenAI GPT-5 System Card - MMLU Language Arabic0.9Accuracy100
OpenAI GPT-5 System Card - MMLU Language French0.91Accuracy100
OpenAI GPT-5 System Card - MMLU Language German0.91Accuracy100
OpenAI GPT-5 System Card - MMLU Language Italian0.91Accuracy100
OpenAI GPT-5 System Card - MMLU Language Spanish0.91Accuracy100
OpenAI GPT-5 System Card - Virology Capabilities Test42Mean Accuracy (%)100
ResearchCodeBench59.4Task Success Rate (%)96.8

Interactive version: theaggregate.ai/model?slug=o3-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.