O3 Mini (Low): benchmark results
O3 Mini evaluated at the low reasoning-effort setting. Provider: OpenAI. Released 2025-01-31. Access: API.
Unified ELO 1551 ± 1, rank #634 of 1761 rated models, from 31 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| FlagEval VQA - Multi-Image Analysis | 61.7 | Score | 95.7 |
| SciCode | 33.3 | Subproblem Resolve Rate (%) | 94.4 |
| ZebraLogic | 74.8 | Puzzle Accuracy (%) | 93.4 |
| FlagEval VQA - Long-tail Recognition | 52.3 | Score | 89.1 |
| AidanBench | 2300 | Novel Answers | 87.3 |
| FlagEval VQA - Geographic Reasoning | 66.5 | Score | 82.6 |
| FlagEval VQA - Overall | 56.58 | Score | 82.6 |
| FlagEval VQA - Scene Understanding | 76.7 | Score | 78.3 |
| FlagEval VQA - Spatial Reasoning | 37.9 | Score | 76.1 |
| FlagEval VQA - Chart Understanding | 52.6 | Score | 71.7 |
| FormationEval | 94.9 | Accuracy (%) | 69.7 |
| FlagEval VQA - Subject Knowledge | 63.5 | Score | 69.6 |
Interactive version: theaggregate.ai/model?slug=o3-mini-low · How It Works · Data refreshed daily, snapshot 2026-09-05.