O1 (2024-12-17) (High): benchmark results

O1 (2024-12-17) evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2024-12-17. Access: API.

Unified ELO 1593 ± 1, rank #464 of 1761 rated models, from 27 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Vals AI MedQA96.52Accuracy (%)100
UGI - Natural Intelligence63.08NatInt Score95.3
UGI - Writing60.11Writing Score92.9
Arena-Hard v2 (GPT-4.1 Judge)58.7Win Rate (%)85.2
MATH Level 594.71Accuracy (%)84.3
Arena-Hard v261Win Rate (%)77.8
Vals AI TaxEval v274.28Accuracy (%)73.6
Aider polyglot coding leaderboard61.7Pass rate (%)71.2
Arena-Hard Creative Writing59.9Win Rate (%)66.7
Vals AI MATH 50090.4Accuracy (%)63.4
OTIS Mock AIME 2024-2573.33Accuracy (%)58.3
UGI Leaderboard37.24UGI Score58.1

Interactive version: theaggregate.ai/model?slug=o1-2024-12-17-high · How It Works · Data refreshed daily, snapshot 2026-09-05.