ChatGPT: benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1514 ± 18, rank #1010 of 2656 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
InstructEval - Alignment (HHH)86.6Average (%, harmless/helpful/honest)100
InstructEval - Problem Solving64.5Average (%, MMLU/BBH/DROP/CRASS/HumanEval)100
EvoEval Combine33Pass@1 (%)94
EvoEval Subtle70Pass@1 (%)94
MoralChoice100MoralChoice Acc (%)92.5
EvoEval57.23Pass@1 (%)90
EvoEval Tool Use64Pass@1 (%)89
EvoEval Creative42Pass@1 (%)86
ShoppingMMLU65.3Average Score (%)84.6
EvoEval Verbose70.73Pass@1 (%)84
EvoEval Concise68.29Pass@1 (%)78
EvoEval Difficult33Pass@1 (%)74

Interactive version: theaggregate.ai/model?slug=chatgpt · How It Works · Data refreshed daily, snapshot 2026-09-19.