GPT-5 (Thinking) — benchmark results

OpenAI GPT-5 thinking model for more deliberate reasoning and tool-use tasks. Provider: OpenAI. Released 2025-08-07. Access: API.

Unified ELO 1824 ± 14, rank #120 of 1776 rated models, from 34 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenAI GPT-5 System Card - BBQ Disambiguated0.88Accuracy100
OpenAI GPT-5 System Card - HealthBench67.2Score (%)100
OpenAI GPT-5 System Card - HealthBench Hard46.2Score (%)100
OpenAI GPT-5 System Card - MMLU Language Bengali0.89Accuracy100
OpenAI GPT-5 System Card - MMLU Language Chinese0.9Accuracy100
OpenAI GPT-5 System Card - MMLU Language Hindi0.9Accuracy100
OpenAI GPT-5 System Card - MMLU Language Indonesian0.91Accuracy100
OpenAI GPT-5 System Card - MMLU Language Japanese0.9Accuracy100
OpenAI GPT-5 System Card - MMLU Language Korean0.9Accuracy100
OpenAI GPT-5 System Card - MMLU Language Swahili0.88Accuracy100
OpenAI GPT-5 System Card - MMLU Language Yoruba0.81Accuracy100
OpenAI GPT-5 System Card - Virology Capabilities Test Text-Only46Mean Accuracy (%)100

Interactive version: theaggregate.ai/model?slug=gpt-5-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.