O3 (2025-04-16) — benchmark results

April 16, 2025 O3 snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2025-04-16. Access: API.

Unified ELO 1722 ± 19, rank #236 of 1776 rated models, from 169 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Arena-Hard v285.9Win Rate (%)100
Arena-Hard v2 (GPT-4.1 Judge)87Win Rate (%)100
EuroEval French NLU - Allocine98.19Sentiment classification Score (%)100
HELM Capabilities - GPQA75.34COT correct100
HindiGen85.563C3H Score (%)100
KOFFVQA - Commonsense Reasoning96.22Score (%)100
LMGame-Bench Candy Crush647Score100
LMGame-Bench Super Mario Bros3445Score100
EuroEval German Knowledge91.87Knowledge Average Score (%)99.7
EuroEval Danish NLU - Dansk71.31Named entity recognition Score (%)99.5
EuroEval Portuguese Knowledge92.18Knowledge Average Score (%)99.5
EuroEval French Knowledge87.14Knowledge Average Score (%)99.4

Interactive version: theaggregate.ai/model?slug=o3-2025-04-16 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.