O3 (2025-04-16) (High): benchmark results

O3 (2025-04-16) evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1655 ± 1, rank #228 of 1761 rated models, from 35 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI - Writing66.75Writing Score96.5
UGI - Natural Intelligence66.19NatInt Score96.4
MATH Level 597.77Accuracy (%)95.4
Vals AI MedQA96.06Accuracy (%)94.1
Vals AI MATH 50094.6Accuracy (%)89.4
UGI Leaderboard46.52UGI Score83.5
Chess Puzzles (Epoch AI)34Accuracy (%)83.3
Epoch AI - Mystery Game Puzzles29Score79.4
Vals AI TaxEval v274.57Accuracy (%)77.1
Conceptual Reasoning Index - Argument Evaluation (LMCA)39.7Chance-Corrected Score (0-100)77
SimpleQA Verified49.4Accuracy (%)74
MedCode47.29Score (self-reported)73

Interactive version: theaggregate.ai/model?slug=o3-2025-04-16-high · How It Works · Data refreshed daily, snapshot 2026-09-05.