O1 Preview — benchmark results

OpenAI's September 2024 preview release of the o1 reasoning model. Provider: OpenAI. Released 2024-09-12. Access: API.

Unified ELO 1709 ± 22, rank #260 of 1776 rated models, from 77 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Divergent Thinking4.79Divergence Score100
EvalPlus84.6EvalPlus Avg. (self-reported)100
FullStackBench en65.62Score (self-reported)100
LLM2014 Logic 2024-0987.52Score (%)100
LLM2014 Logic 2024-1086.55Score (%)100
MBPP+80.2MBPP+ pass@1 (self-reported)100
MixEval72Score100
Multi-IF87.7Average (self-reported)100
SEAL - Japanese1118Score100
SEAL - Korean66.43Score100
WebApp1K-React0.95pass@1100
HumanEval+89HumanEval+ pass@1 (self-reported)97.8

Interactive version: theaggregate.ai/model?slug=o1-preview · How the rankings work · Data refreshed daily, snapshot 2026-07-22.