GPT-4o Mini (2024-07-18) — benchmark results
July 18, 2024 GPT-4o Mini snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-07-18. Access: API.
Unified ELO 1540 ± 8, rank #647 of 1776 rated models, from 284 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM MedHELM - EHRSHOT | 90.67 | EM | 100 |
| KOFFVQA - Korean OCR | 100 | Score (%) | 100 |
| LLM Trustworthy - Adversarial Demo | 88.49 | Trust Score (%) | 100 |
| PIQA | 88.7 | Accuracy (%) | 98.3 |
| WildBench | 57.14 | WB Score Task-Macro | 96.8 |
| HELM SeaHELM - Flores (en-id) | 69.86 | ChrF++ | 95 |
| Arabic IFEval | 71.4 | Arabic Accuracy (%) | 94.9 |
| GSM8K | 91.3 | Accuracy (%) | 93.6 |
| HELM EWoK - Physical Dynamics | 90 | EM | 92.9 |
| EvalPlus (HumanEval+ & MBPP+) | 77.8 | Pass@1 avg (%) | 91.9 |
| VNTL Leaderboard | 72.23 | Accuracy (%) | 91.9 |
| LiveBench Cta | 58 | Score | 91 |
Interactive version: theaggregate.ai/model?slug=gpt-4o-mini-2024-07-18 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.