O1 Mini (2024-09-12) — benchmark results

September 12, 2024 O1 Mini snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-09-12. Access: API.

Unified ELO 1527 ± 31, rank #697 of 1776 rated models, from 36 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EvalPlus (HumanEval+ & MBPP+)83.9Pass@1 avg (%)98.4
ZebraLogic59.7Puzzle Accuracy (%)90.2
HELM Safety BBQ96.9BBQ accuracy (%)87.2
AraGen70.463C3H Score (%)83.6
X-Risks Leaderboard20.783C3H Score (%)77.8
HELM Safety95.5Mean score (self-reported)74
HELM Safety HarmBench88.5LM Evaluated Safety score (%)72.1
HELM Safety XSTest97LM Evaluated Safety score (%)69.2
LMGame-Bench 20482757.3Score58.3
LLM Arena RU1027Arena Elo57.1
Wolfram LLM Benchmarking Project43.5Correct Functionality (%)56.1
SuperGPQA45.22Accuracy (%)54.4

Interactive version: theaggregate.ai/model?slug=o1-mini-2024-09-12 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.