O3 (2025-04-16) (Medium): benchmark results

O3 (2025-04-16) evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1658 ± 1, rank #217 of 1761 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Fiction.LiveBench100Accuracy (%)100
UGI - Writing66.83Writing Score96.6
UGI - Natural Intelligence65.92NatInt Score96.3
Chess Puzzles (Epoch AI)38Accuracy (%)86.5
UGI Leaderboard47.45UGI Score84.9
VPCT52Accuracy (%)71.8
OTIS Mock AIME 2024-2584.44Accuracy (%)70
Epoch AI - Mystery Game Puzzles23Score68.1
SEAL - MultiNRC44.45Score65.1
Wolfram LLM Benchmarking Project47.4Correct Functionality (%)62.9
SEAL - TutorBench52.76Score53.8
FrontierMath - Tiers 1-3 (v2)29.82Accuracy (%, 285 private v2 problems)47.6

Interactive version: theaggregate.ai/model?slug=o3-2025-04-16-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.