GPT-4o (2024-11-20) — benchmark results

November 20, 2024 GPT-4o snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2024-11-20. Access: API.

Unified ELO 1596 ± 15, rank #482 of 1776 rated models, from 181 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ACEBench89.6Overall (self-reported)100
CAIS Risk Index67Risk Index (self-reported)100
HELM SeaHELM - Flores (en-id)70.52ChrF++100
HELM SeaHELM - Flores (en-th)49.14ChrF++100
HELM SeaHELM - Flores (en-vi)62.33ChrF++100
HELM SeaHELM - Flores (vi-en)61.6ChrF++100
HELM SeaHELM - ViHSD61.63Macro F1 score100
HELM SeaHELM - XNLI (vi)68.9EM100
J1-ENVS63.9Overall Score (self-reported)100
MMLU88.1Accuracy (%)99.3
Greek MMLU - Greek-Specific93.11Accuracy (%)98.8
Greek MMLU - Humanities88.68Accuracy (%)98.8

Interactive version: theaggregate.ai/model?slug=gpt-4o-2024-11-20 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.