O3 Mini (High): benchmark results

O3 Mini evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-01-31. Access: API.

Unified ELO 1572 ± 1, rank #546 of 1761 rated models, from 109 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BBEH44.8Harmonic Mean (%)100
Can LLMs Falsify?8.9Counterexample Rate (%)100
SEAL - Agentic Tool Use (Chat)63.45Score100
SciCode34.4Subproblem Resolve Rate (%)100
AidanBench4921Novel Answers98.2
ProLLM - Q&A Assistant98.2Score (%)94.1
LiveOIBench60.86Avg Human Percentile93
FlagEval VQA - Multi-Image Analysis60Score91.3
ResearchCodeBench52.4Task Success Rate (%)87.1
FlagEval VQA - Geographic Reasoning67.5Score87
FlagEval VQA - Overall57.17Score87
FlagEval VQA - Spatial Reasoning39.3Score87

Interactive version: theaggregate.ai/model?slug=o3-mini-high · How It Works · Data refreshed daily, snapshot 2026-09-05.