O1 (Medium): benchmark results

O1 evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2024-12-05. Access: API.

Unified ELO 1609 ± 1, rank #391 of 1761 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AI for Education Pedagogy - Social studies90Accuracy (%)97.7
Gapminder AI Worldview90.9Correct Rate (%)94.1
MATH Level 594.41Accuracy (%)83.3
AI for Education Pedagogy - Science90.71Accuracy (%)82.6
AI for Education Pedagogy - Secondary86.64Accuracy (%)80.9
AI for Education Pedagogy86.43Accuracy (%)76.1
AI for Education Pedagogy - Technology83.02Accuracy (%)75.8
PlatinumBench (MIT)1.27Avg Error Rate (%)75.8
AI for Education SEND79.36Accuracy (%)70.1
LLM Chess (Saplin)280.1ELO67.1
AI for Education Pedagogy - Primary87.32Accuracy (%)65.3
OTIS Mock AIME 2024-2573.33Accuracy (%)58.3

Interactive version: theaggregate.ai/model?slug=o1-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.