GPT-4o (2024-11-20) — benchmark results
November 20, 2024 GPT-4o snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-11-20. Access: API.
Unified ELO 1596 ± 15, rank #482 of 1776 rated models, from 181 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ACEBench | 89.6 | Overall (self-reported) | 100 |
| CAIS Risk Index | 67 | Risk Index (self-reported) | 100 |
| HELM SeaHELM - Flores (en-id) | 70.52 | ChrF++ | 100 |
| HELM SeaHELM - Flores (en-th) | 49.14 | ChrF++ | 100 |
| HELM SeaHELM - Flores (en-vi) | 62.33 | ChrF++ | 100 |
| HELM SeaHELM - Flores (vi-en) | 61.6 | ChrF++ | 100 |
| HELM SeaHELM - ViHSD | 61.63 | Macro F1 score | 100 |
| HELM SeaHELM - XNLI (vi) | 68.9 | EM | 100 |
| J1-ENVS | 63.9 | Overall Score (self-reported) | 100 |
| MMLU | 88.1 | Accuracy (%) | 99.3 |
| Greek MMLU - Greek-Specific | 93.11 | Accuracy (%) | 98.8 |
| Greek MMLU - Humanities | 88.68 | Accuracy (%) | 98.8 |
Interactive version: theaggregate.ai/model?slug=gpt-4o-2024-11-20 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.