O3 (2025-04-16): benchmark results

April 16, 2025 O3 snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1665 ± 1, rank #103 of 1392 rated models, from 210 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Arena-Hard v285.9Win Rate (%)100
Arena-Hard v2 (GPT-4.1 Judge)87Win Rate (%)100
EuroEval French NLU - Allocine98.19Sentiment classification Score (%)100
HELM Capabilities - GPQA75.34COT correct100
HindiGen85.563C3H Score (%)100
KOFFVQA - Commonsense Reasoning96.22Score (%)100
LMGame-Bench Candy Crush647Score100
LMGame-Bench Super Mario Bros3445Score100
EuroEval German Knowledge91.87Knowledge Average Score (%)99.7
Nejumi 4 - ALT - Robustness100Score (%)99.6
EuroEval Danish NLU - Dansk71.31Named entity recognition Score (%)99.5
EuroEval Portuguese Knowledge92.18Knowledge Average Score (%)99.5

Interactive version: theaggregate.ai/model?slug=o3-2025-04-16 · How It Works · Data refreshed daily, snapshot 2026-09-05.