O1 Mini (2024-09-12): benchmark results

September 12, 2024 O1 Mini snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-09-12. Access: API.

Unified ELO 1511 ± 1, rank #645 of 1392 rated models, from 39 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EvalPlus (HumanEval+ & MBPP+)83.9Pass@1 avg (%)98.4
HumanEval+89HumanEval+ pass@1 (self-reported)97.8
EvalPlus83.9EvalPlus Avg. (self-reported)95.8
MBPP+78.8MBPP+ pass@1 (self-reported)95.8
ZebraLogic59.7Puzzle Accuracy (%)90.2
HELM Safety BBQ96.9BBQ accuracy (%)87.2
AraGen70.463C3H Score (%)83.6
X-Risks Leaderboard20.783C3H Score (%)77.8
HELM Safety95.53Mean score (self-reported)75
TextClass Benchmark1626.65Meta-Elo (self-reported)73.8
HELM Safety HarmBench88.5LM Evaluated Safety score (%)72.1
HELM Safety XSTest97LM Evaluated Safety score (%)69.2

Interactive version: theaggregate.ai/model?slug=o1-mini-2024-09-12 · How It Works · Data refreshed daily, snapshot 2026-09-05.