O3 Mini (2025-01-31) (High): benchmark results
O3 Mini (2025-01-31) evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-01-31. Access: API.
Unified ELO 1579 ± 1, rank #521 of 1761 rated models, from 28 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ZebraLogic | 91.7 | Puzzle Accuracy (%) | 100 |
| RepairBench | 46.4 | Plausible@1 (%) | 97.4 |
| Defects4J | 48.8 | Defects4J Plausible @1 (self-reported) | 97.1 |
| MATH Level 5 | 96.49 | Accuracy (%) | 90.7 |
| Arena-Hard v2 (GPT-4.1 Judge) | 64.8 | Win Rate (%) | 88.9 |
| Vals AI MedQA | 94.83 | Accuracy (%) | 86.2 |
| Arena-Hard v2 | 66.1 | Win Rate (%) | 81.5 |
| SuperGPQA | 55.22 | Accuracy (%) | 73.5 |
| Vals AI MATH 500 | 91.8 | Accuracy (%) | 72.5 |
| Vals AI AIME | 86.46 | Accuracy (%) | 67.4 |
| Vals AI MGSM | 91.35 | Accuracy (%) | 65.3 |
| OTIS Mock AIME 2024-25 | 76.94 | Accuracy (%) | 60.4 |
Interactive version: theaggregate.ai/model?slug=o3-mini-2025-01-31-high · How It Works · Data refreshed daily, snapshot 2026-09-05.