GPT-5.1 (High) — benchmark results

GPT-5.1 evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2025-11-12. Access: API.

Unified ELO 1806 ± 14, rank #137 of 1776 rated models, from 123 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Long Context Reasoning75Accuracy (%)99.6
AA Global-MMLU-Lite - French93.5Accuracy (%)99.1
Vals AI CaseLaw v273.42Accuracy (%)98.3
MedScribe88.09Score (self-reported)98.1
AA LiveCodeBench86.77Pass@1 (%)97.5
CLBench23.7Solving Rate (%)97.1
AA Global-MMLU-Lite - English94.08Accuracy (%)96.6
AA MMLU-Pro87.04Accuracy (%)96.5
LLM2014 Logic 2025-1179.53Median Score96.2
LLM2014 Logic 2025-1277.54Median Score96
AA Global-MMLU-Lite - Bengali90.92Accuracy (%)95.8
AA Global-MMLU-Lite - Swahili89.58Accuracy (%)95

Interactive version: theaggregate.ai/model?slug=gpt-5-1-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.