GPT-5 (Thinking) — benchmark results
OpenAI GPT-5 thinking model for more deliberate reasoning and tool-use tasks. Provider: OpenAI. Released 2025-08-07. Access: API.
Unified ELO 1824 ± 14, rank #120 of 1776 rated models, from 34 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| OpenAI GPT-5 System Card - BBQ Disambiguated | 0.88 | Accuracy | 100 |
| OpenAI GPT-5 System Card - HealthBench | 67.2 | Score (%) | 100 |
| OpenAI GPT-5 System Card - HealthBench Hard | 46.2 | Score (%) | 100 |
| OpenAI GPT-5 System Card - MMLU Language Bengali | 0.89 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Chinese | 0.9 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Hindi | 0.9 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Indonesian | 0.91 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Japanese | 0.9 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Korean | 0.9 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Swahili | 0.88 | Accuracy | 100 |
| OpenAI GPT-5 System Card - MMLU Language Yoruba | 0.81 | Accuracy | 100 |
| OpenAI GPT-5 System Card - Virology Capabilities Test Text-Only | 46 | Mean Accuracy (%) | 100 |
Interactive version: theaggregate.ai/model?slug=gpt-5-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.