O3 Mini (2025-01-31) — benchmark results

January 31, 2025 O3 Mini snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2025-01-31. Access: API.

Unified ELO 1606 ± 9, rank #467 of 1776 rated models, from 199 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BIRD-CRITIC34.5Score100
HELM MedHELM - CLEAR83.06EM100
HELM MedHELM - Medec68.68MedecFlagAcc100
HELM MedHELM - Medical Research76.39Mean win rate100
HELM MedHELM - SHC-GIP78.4EM100
EuroEval Danish NLU - Angry Tweets62.16Sentiment classification Score (%)98.6
Galileo Tool Tasks - xLAM Single Tool Single Call100Accuracy (%)97.2
HELM MedHELM - n2c2 CT Matching89.53EM95.8
Galileo Tool Tasks - BFCL v3 Multi-Turn Missing Parameter93Accuracy (%)94.4
EuroEval English NLU - CoNLL EN84.79Named entity recognition Score (%)92.5
EuroEval English Knowledge93.33Knowledge Average Score (%)92.1
Galileo Tool Tasks - ToolACE Single Function Call97.5Accuracy (%)91.7

Interactive version: theaggregate.ai/model?slug=o3-mini-2025-01-31 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.