GPT-4 Turbo (Preview): benchmark results

OpenAI preview GPT-4 Turbo model row, tracked separately from the GA GPT-4 Turbo row. Provider: OpenAI. Released 2023-11-06. Access: API.

Unified ELO 1540 ± 1, rank #482 of 1392 rated models, from 26 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
T-Eval86.4Overall Score (%)100
InfiBench68.42Score (%)99
Klu LLM Leaderboard100Klu Index98.8
ENAMEL47eff@1 (self-reported)96.8
Natural2Code51.5Score (self-reported)91.3
EvalPlus (HumanEval+ & MBPP+)77.5Pass@1 avg (%)91.1
LLM-AggreFact76.16Balanced Accuracy (%)89.5
HELM NaturalQuestions (Open)76.29F1 (%)82.2
HELM NaturalQuestions (Closed)43.47F1 (%)77.8
SEAL - Korean60.76Score77.8
HELM (Stanford)69.82Mean Win Rate (%)74.4
SEAL - Math95.1Score73.3

Interactive version: theaggregate.ai/model?slug=gpt-4-turbo-preview · How It Works · Data refreshed daily, snapshot 2026-09-05.