GPT-4o (2024-05-13): benchmark results
May 13, 2024 GPT-4o snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-05-13. Access: API.
Unified ELO 1572 ± 1, rank #349 of 1392 rated models, from 257 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| BenchBench | 97.67 | Aggregate Score (%) | 100 |
| HELM (Stanford) | 93.76 | Mean Win Rate (%) | 100 |
| HELM Finance - BANKING77 | 78.5 | EM | 100 |
| HELM Lite | 95.95 | Mean win rate (self-reported) | 100 |
| HELM MedHELM - ADHD-Behavior | 83.69 | EM | 100 |
| HELM MedHELM - EHRSQL | 32 | EHRSQLExeAcc | 100 |
| HELM MedHELM - SHC-ENT | 61.1 | EM | 100 |
| HELM NarrativeQA | 80.39 | F1 (%) | 100 |
| LogicKor | 9.41 | Score (0-10) | 100 |
| LogicKor - Multi-Turn | 9.5 | Score (0-10) | 100 |
| LogicKor - Single-Turn | 9.42 | Score (0-10) | 100 |
| MAGI-Hard | 80.86 | Accuracy (%, 2024-05 snapshot) | 100 |
Interactive version: theaggregate.ai/model?slug=gpt-4o-2024-05-13 · How It Works · Data refreshed daily, snapshot 2026-09-05.