GPT-4 Turbo (Preview) — benchmark results

OpenAI preview GPT-4 Turbo model row, tracked separately from the GA GPT-4 Turbo row. Provider: OpenAI. Released 2023-11-06. Access: API.

Unified ELO 1595 ± 32, rank #486 of 1776 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
T-Eval86.4Overall Score (%)100
InfiBench68.42Score (%)99
Klu LLM Leaderboard100Klu Index98.8
EvalPlus (HumanEval+ & MBPP+)77.5Pass@1 avg (%)91.1
LLM-AggreFact76.16Balanced Accuracy (%)89.5
HELM NaturalQuestions (Open)76.29F1 (%)82.2
HELM NaturalQuestions (Closed)43.47F1 (%)77.8
SEAL - Korean60.76Score77.8
HELM (Stanford)69.82Mean Win Rate (%)74.4
SEAL - Math95.1Score73.3
SEAL - Adversarial Robustness20Score71.4
SpeechMap Compliance75.1% Requests Completed68.5

Interactive version: theaggregate.ai/model?slug=gpt-4-turbo-preview · How the rankings work · Data refreshed daily, snapshot 2026-07-22.