GPT-5.6 Luna (xHigh) — benchmark results

GPT-5.6 Luna evaluated at the xhigh reasoning-effort setting. Provider: OpenAI. Released 2026-07-09. Access: API.

Unified ELO 1901 ± 30, rank #64 of 1776 rated models, from 43 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Kotlin70Accuracy (%)96.4
AA CritPt20.57Accuracy (%)96.1
Artificial Analysis Intelligence Index49.07Intelligence Index95.9
AA Omniscience - Software Engineering (SWE) - TypeScript75.56Accuracy (%)95.3
AA Humanity's Last Exam35.59Accuracy (%)93.5
GDPval-AA1539Elo93.5
AA GDPval1539.11ELO93.3
AA Omniscience - Software Engineering (SWE) - Python71Accuracy (%)93.2
AA Omniscience - Software Engineering (SWE) - Go66Accuracy (%)93.1
AA Long Context Reasoning69.67Accuracy (%)92.7
AA GPQA Diamond89.49Accuracy (%)92.5
AA SciCode50Accuracy (%)92.5

Interactive version: theaggregate.ai/model?slug=gpt-5-6-luna-xhigh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.