GPT-5.5 (xHigh) — benchmark results

GPT-5.5 evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2026-04-23. Access: API.

Unified ELO 2057 ± 17, rank #13 of 1776 rated models, from 140 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Rust92Accuracy (%)100
ALE-Bench1942.97Performance (Self-Refine x1) (self-reported)100
ClawProBench67.9Final Score (self-reported)100
GRIPS96.4Accuracy (%)100
GRIPS-hard87.3Accuracy (%)100
LLM2014 Logic 2026-0483.96Median Score100
LLM2014 Logic 2026-0580.47Median Score100
LLM2014 Logic 2026-0680.47Median Score100
LLM2014 Logic 2026-0777.46Median Score100
LiveBench81.28LiveBench average (self-reported)100
MathArena - APEX Shortlist 202598.4Accuracy (%)100
MathArena - ARXIV March77.5Accuracy (%)100

Interactive version: theaggregate.ai/model?slug=gpt-5-5-xhigh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.