O3 (2025-04-16) (Medium) — benchmark results

O3 (2025-04-16) evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1845 ± 69, rank #107 of 1776 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Fiction.LiveBench100Accuracy (%)100
UGI - Writing66.83Writing Score97.3
UGI - Natural Intelligence65.92NatInt Score96.9
SEAL - EnigmaEval13.09Score91.9
UGI Leaderboard47.45UGI Score84.9
VPCT52Accuracy (%)71.8
MultiNRC44.45Score (self-reported)65.8
Wolfram LLM Benchmarking Project47.4Correct Functionality (%)65.4
SEAL - MultiNRC44.45Score65.1
SEAL - TutorBench52.76Score53.8
TutorBench52.76Score (self-reported)50
DeepResearchBench46.6Average Score40

Interactive version: theaggregate.ai/model?slug=o3-2025-04-16-medium · How the rankings work · Data refreshed daily, snapshot 2026-07-22.