GPT-5.1 (High): benchmark results

GPT-5.1 evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-11-12. Access: API.

Unified ELO 1668 ± 1, rank #185 of 1761 rated models, from 165 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Global-MMLU-Lite - French93.5Accuracy (%)99.1
Vals AI MedQA96.38Accuracy (%)98.9
Vals AI CaseLaw v273.42Accuracy (%)98.3
AA LiveCodeBench86.77Pass@1 (%)97.5
CLBench23.7Solving Rate (%)97.1
AA Omniscience - Software Engineering (SWE) - R42Accuracy (%)96.8
AA MMLU-Pro87.04Accuracy (%)96.7
AA Global-MMLU-Lite - English94.08Accuracy (%)96.4
LLM2014 Logic 2025-1179.53Median Score96.2
AA AIME 202594Accuracy (%)96.1
AA Omniscience - Software Engineering (SWE) - JavaScript55.45Accuracy (%)96.1
AA Omniscience - Software Engineering (SWE) - Swift64Accuracy (%)96.1

Interactive version: theaggregate.ai/model?slug=gpt-5-1-high · How It Works · Data refreshed daily, snapshot 2026-09-05.