GPT-4o ChatGPT — benchmark results

ChatGPT-tuned GPT-4o row (chatgpt-4o-latest), tracked separately from the API GPT-4o. Provider: OpenAI. Released 2024-05-13. Access: API.

Unified ELO 1629 ± 10, rank #415 of 1776 rated models, from 282 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Darija Chatbot Arena1400.6Elo Rating100
LiveBench Table Join45.3Score100
Open LMM Reasoning - DynaMath48.5Accuracy (%)100
Open LMM Reasoning - DynaMath - Level-undergraduate47.8Accuracy (%)100
Open LMM Reasoning - DynaMath - Level-undergraduate; Avg76.2Accuracy (%)100
Open LMM Reasoning - DynaMath - Overall; Avg72.7Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-graph theory43.8Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-graph theory; Avg75.4Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-statistics60Accuracy (%)100
Open LMM Reasoning - LogicVista - mechanical75.7Accuracy (%)100
Open LMM Reasoning - WeMath - Understanding and Conversion of Units95.6Accuracy (%)100
OpenVLM MMBench V1.1 EN - Image Style92.4Accuracy (%)99.8

Interactive version: theaggregate.ai/model?slug=gpt-4o-chatgpt · How the rankings work · Data refreshed daily, snapshot 2026-07-22.