GPT-5 (Medium): benchmark results

GPT-5 evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2025-08-07. Access: API.

Unified ELO 1651 ± 1, rank #243 of 1761 rated models, from 163 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HAL Online Mind2Web42.33Accuracy (%)100
HAL USACO69.06Accuracy (%)100
Step Game (Lechmazur)5.49TrueSkill μ100
SudokuBench (Single-shot, 4x4)86.74x4 Solve Rate (%)100
Translation (Lechmazur)8.69Mean Score100
AI for Education Pedagogy - Social studies90.91Accuracy (%)98.9
Aider polyglot coding leaderboard86.7Pass rate (%)98.5
Elimination Game (Lechmazur)5.97TrueSkill μ98.3
MATH Level 597.92Accuracy (%)98.1
AA Omniscience - Software Engineering (SWE) - PHP58Accuracy (%)96.8
AA Omniscience - Software Engineering (SWE) - Dart42Accuracy (%)96.4
MCP-Universe43.72Overall Success Rate (self-reported)96.3

Interactive version: theaggregate.ai/model?slug=gpt-5-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.