GPT-4o (2024-05-13): benchmark results

May 13, 2024 GPT-4o snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-05-13. Access: API.

Unified ELO 1572 ± 1, rank #349 of 1392 rated models, from 257 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BenchBench97.67Aggregate Score (%)100
HELM (Stanford)93.76Mean Win Rate (%)100
HELM Finance - BANKING7778.5EM100
HELM Lite95.95Mean win rate (self-reported)100
HELM MedHELM - ADHD-Behavior83.69EM100
HELM MedHELM - EHRSQL32EHRSQLExeAcc100
HELM MedHELM - SHC-ENT61.1EM100
HELM NarrativeQA80.39F1 (%)100
LogicKor9.41Score (0-10)100
LogicKor - Multi-Turn9.5Score (0-10)100
LogicKor - Single-Turn9.42Score (0-10)100
MAGI-Hard80.86Accuracy (%, 2024-05 snapshot)100

Interactive version: theaggregate.ai/model?slug=gpt-4o-2024-05-13 · How It Works · Data refreshed daily, snapshot 2026-09-05.