O3 Mini (Low): benchmark results

O3 Mini evaluated at the low reasoning-effort setting. Provider: OpenAI. Released 2025-01-31. Access: API.

Unified ELO 1551 ± 1, rank #634 of 1761 rated models, from 31 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
FlagEval VQA - Multi-Image Analysis61.7Score95.7
SciCode33.3Subproblem Resolve Rate (%)94.4
ZebraLogic74.8Puzzle Accuracy (%)93.4
FlagEval VQA - Long-tail Recognition52.3Score89.1
AidanBench2300Novel Answers87.3
FlagEval VQA - Geographic Reasoning66.5Score82.6
FlagEval VQA - Overall56.58Score82.6
FlagEval VQA - Scene Understanding76.7Score78.3
FlagEval VQA - Spatial Reasoning37.9Score76.1
FlagEval VQA - Chart Understanding52.6Score71.7
FormationEval94.9Accuracy (%)69.7
FlagEval VQA - Subject Knowledge63.5Score69.6

Interactive version: theaggregate.ai/model?slug=o3-mini-low · How It Works · Data refreshed daily, snapshot 2026-09-05.