O1 — benchmark results

OpenAI's first-generation o-series reasoning model for difficult multi-step tasks. Provider: OpenAI. Released 2024-12-05. Access: API.

Unified ELO 1696 ± 14, rank #277 of 1776 rated models, from 223 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AidanBench6054Novel Answers100
BlueBench - Knowledge71.43Score (%)100
BlueBench - Reasoning79Score (%)100
CRMArena - BRI74.8BRI Score (%)100
CRMArena - HTU68.5HTU Score (%)100
CRMArena - NED60NED Score (%)100
CRMArena - Overall64.3Overall Score (%)100
CRMArena - TII99.2TII Score (%)100
ClinPivot69.32ClinPivot (self-reported)100
DROP90.2F1 Score100
KernelBench1Avg Speedup vs PyTorch100
LLM2014 Logic 2024-1294.58Score (%)100

Interactive version: theaggregate.ai/model?slug=o1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.