GPT-4o (2024-05-13) — benchmark results

May 13, 2024 GPT-4o snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-05-13. Access: API.

Unified ELO 1616 ± 10, rank #440 of 1776 rated models, from 215 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BenchBench97.67Aggregate Score (%)100
HELM (Stanford)93.76Mean Win Rate (%)100
HELM Finance - BANKING7778.5EM100
HELM MedHELM - ADHD-Behavior83.69EM100
HELM MedHELM - EHRSQL32EHRSQLExeAcc100
HELM MedHELM - SHC-ENT61.1EM100
HELM NarrativeQA80.39F1 (%)100
LiveBench Cta64Score100
LogicKor9.41Score (0-10)100
LogicKor - Multi-Turn9.5Score (0-10)100
LogicKor - Single-Turn9.42Score (0-10)100
MathBench70.9Average Score100

Interactive version: theaggregate.ai/model?slug=gpt-4o-2024-05-13 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.