GPT-5 (2025-08-07) — benchmark results
August 7, 2025 GPT-5 snapshot, tracked when sources report the dated API model. Provider: OpenAI. Released 2025-08-07. Access: API.
Unified ELO 1661 ± 10, rank #342 of 1776 rated models, from 185 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM MedHELM - ACI-Bench | 4.86 | Jury Score | 100 |
| HELM MedHELM - Administration & Workflow | 86.67 | Mean win rate | 100 |
| HELM MedHELM - DischargeMe | 4.67 | Jury Score | 100 |
| HELM MedHELM - HeadQA | 93.7 | EM | 100 |
| HELM MedHELM - MIMIC-BHC | 4.13 | Jury Score | 100 |
| HELM MedHELM - MIMIC-IV Billing Code | 42.9 | MIMICBillingF1 | 100 |
| HELM MedHELM - MIMIC-RRS | 4.72 | Jury Score | 100 |
| HELM MedHELM - MedMCQA | 84.7 | EM | 100 |
| HELM MedHELM - MedQA | 96.82 | EM | 100 |
| HELM MedHELM - SHC-CDI | 62.4 | EM | 100 |
| OpenCompass Multimodal - MMMU | 81.8 | Score (%) | 100 |
| OpenVLM HallusionBench - fAcc | 62.4 | Accuracy (%) | 100 |
Interactive version: theaggregate.ai/model?slug=gpt-5-2025-08-07 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.