O3 Mini (2025-01-31) (High) — benchmark results

O3 Mini (2025-01-31) evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-01-31. Access: API.

Unified ELO 1811 ± 66, rank #130 of 1776 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ZebraLogic91.7Puzzle Accuracy (%)100
RepairBench46.4Plausible@1 (%)97.4
MATH Level 596.49Accuracy (%)90.7
Arena-Hard v2 (GPT-4.1 Judge)64.8Win Rate (%)88.9
Arena-Hard v266.1Win Rate (%)81.5
SuperGPQA55.22Accuracy (%)73.5
OTIS Mock AIME 2024-2576.94Accuracy (%)59.6
LiveCodeBench77.7Pass@1 avg (%)55.6
Arena-Hard Creative Writing43Win Rate (%)40.7
Chess Puzzles (Epoch AI)17Accuracy (%)24.1

Interactive version: theaggregate.ai/model?slug=o3-mini-2025-01-31-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.