GPT-4 Turbo: benchmark results

OpenAI's faster, cheaper GPT-4 tier with a 128K context. Provider: OpenAI. Released 2024-04-09. Access: API.

Unified ELO 1548 ± 1, rank #444 of 1392 rated models, from 214 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AutoRace61Average Score (%, six reasoning tasks)100
EconLogicQA0.57Accuracy100
EvalPlus (HumanEval+ & MBPP+)86.6Pass@1 avg (%)100
EvoEval68.63Pass@1 (%)100
EvoEval Subtle82Pass@1 (%)100
HELM EWoK - Physical Dynamics91.33EM100
HELM EWoK - Physical Interactions86.61EM100
NPHardEval37.74Average Accuracy (%)100
NPHardEval - EDP53.64Accuracy (%)100
NPHardEval - GCP D73.27Accuracy (%)100
NPHardEval - KSP18.73Accuracy (%)100
NPHardEval - MSP1.27Accuracy (%)100

Interactive version: theaggregate.ai/model?slug=gpt-4-turbo · How It Works · Data refreshed daily, snapshot 2026-09-05.