GPT-4o Mini (2024-07-18) — benchmark results

July 18, 2024 GPT-4o Mini snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-07-18. Access: API.

Unified ELO 1540 ± 8, rank #647 of 1776 rated models, from 284 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM MedHELM - EHRSHOT90.67EM100
KOFFVQA - Korean OCR100Score (%)100
LLM Trustworthy - Adversarial Demo88.49Trust Score (%)100
PIQA88.7Accuracy (%)98.3
WildBench57.14WB Score Task-Macro96.8
HELM SeaHELM - Flores (en-id)69.86ChrF++95
Arabic IFEval71.4Arabic Accuracy (%)94.9
GSM8K91.3Accuracy (%)93.6
HELM EWoK - Physical Dynamics90EM92.9
EvalPlus (HumanEval+ & MBPP+)77.8Pass@1 avg (%)91.9
VNTL Leaderboard72.23Accuracy (%)91.9
LiveBench Cta58Score91

Interactive version: theaggregate.ai/model?slug=gpt-4o-mini-2024-07-18 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.