GPT-4o ChatGPT: benchmark results

ChatGPT-tuned GPT-4o row (chatgpt-4o-latest), tracked separately from the API GPT-4o. Provider: OpenAI. Released 2024-05-13. Access: API.

Unified ELO 1619 ± 1, rank #207 of 1392 rated models, from 273 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Darija Chatbot Arena1400.6Elo Rating100
Open LMM Reasoning - DynaMath48.5Accuracy (%)100
Open LMM Reasoning - DynaMath - Level-undergraduate47.8Accuracy (%)100
Open LMM Reasoning - DynaMath - Level-undergraduate; Avg76.2Accuracy (%)100
Open LMM Reasoning - DynaMath - Overall; Avg72.7Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-graph theory43.8Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-graph theory; Avg75.4Accuracy (%)100
Open LMM Reasoning - DynaMath - Subject-statistics60Accuracy (%)100
Open LMM Reasoning - LogicVista - mechanical75.7Accuracy (%)100
Open LMM Reasoning - WeMath - Understanding and Conversion of Units95.6Accuracy (%)100
OpenVLM MMBench V1.1 EN - Image Style92.4Accuracy (%)99.8
OpenVLM MMBench V1.1 CN - Action Recognition95.7Accuracy (%)99.6

Interactive version: theaggregate.ai/model?slug=gpt-4o-chatgpt · How It Works · Data refreshed daily, snapshot 2026-09-05.