GPT-4 Turbo — benchmark results

OpenAI's faster, cheaper GPT-4 tier with a 128K context. Provider: OpenAI. Released 2024-04-09. Access: API.

Unified ELO 1599 ± 14, rank #476 of 1776 rated models, from 213 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EconLogicQA0.57Accuracy100
EvalPlus (HumanEval+ & MBPP+)86.6Pass@1 avg (%)100
EvoEval68.63Pass@1 (%)100
EvoEval Subtle82Pass@1 (%)100
HELM EWoK - Physical Dynamics91.33EM100
HELM EWoK - Physical Interactions86.61EM100
LLM2014 Logic 2024-0577.05Score (%)100
LLM2014 Logic 2024-0676.53Score (%)100
LLM2014 Logic 2024-0776.65Score (%)100
LLM2014 Logic 2024-0874.86Score (%)100
NPHardEval37.74Average Accuracy (%)100
NPHardEval - EDP53.64Accuracy (%)100

Interactive version: theaggregate.ai/model?slug=gpt-4-turbo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.