GPT-4o ChatGPT — benchmark results
ChatGPT-tuned GPT-4o row (chatgpt-4o-latest), tracked separately from the API GPT-4o. Provider: OpenAI. Released 2024-05-13. Access: API.
Unified ELO 1629 ± 10, rank #415 of 1776 rated models, from 282 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Darija Chatbot Arena | 1400.6 | Elo Rating | 100 |
| LiveBench Table Join | 45.3 | Score | 100 |
| Open LMM Reasoning - DynaMath | 48.5 | Accuracy (%) | 100 |
| Open LMM Reasoning - DynaMath - Level-undergraduate | 47.8 | Accuracy (%) | 100 |
| Open LMM Reasoning - DynaMath - Level-undergraduate; Avg | 76.2 | Accuracy (%) | 100 |
| Open LMM Reasoning - DynaMath - Overall; Avg | 72.7 | Accuracy (%) | 100 |
| Open LMM Reasoning - DynaMath - Subject-graph theory | 43.8 | Accuracy (%) | 100 |
| Open LMM Reasoning - DynaMath - Subject-graph theory; Avg | 75.4 | Accuracy (%) | 100 |
| Open LMM Reasoning - DynaMath - Subject-statistics | 60 | Accuracy (%) | 100 |
| Open LMM Reasoning - LogicVista - mechanical | 75.7 | Accuracy (%) | 100 |
| Open LMM Reasoning - WeMath - Understanding and Conversion of Units | 95.6 | Accuracy (%) | 100 |
| OpenVLM MMBench V1.1 EN - Image Style | 92.4 | Accuracy (%) | 99.8 |
Interactive version: theaggregate.ai/model?slug=gpt-4o-chatgpt · How the rankings work · Data refreshed daily, snapshot 2026-07-22.