GPT-5.6 Luna (High) — benchmark results

GPT-5.6 Luna evaluated at the high reasoning-effort setting. Provider: OpenAI. Released 2026-07-09. Access: API.

Unified ELO 1900 ± 23, rank #65 of 1776 rated models, from 43 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - PHP82Accuracy (%)97.2
AA Omniscience - Software Engineering (SWE) - Swift80Accuracy (%)95.9
AA Omniscience - Software Engineering (SWE) - TypeScript76.67Accuracy (%)95.8
Artificial Analysis Intelligence Index46.06Intelligence Index95.2
AA CritPt16.57Accuracy (%)94.7
AA SciCode50.69Accuracy (%)94.2
AA Omniscience - Software Engineering (SWE) - Python72Accuracy (%)93.9
PM-LLM-Benchmark37.2Score93.7
AA Omniscience - Software Engineering (SWE) - Go66Accuracy (%)93.1
AA Omniscience - Software Engineering (SWE) - Kotlin60Accuracy (%)92
AA Omniscience - Software Engineering (SWE)64.7Accuracy (%)91.9
AA GPQA Diamond89.19Accuracy (%)91.7

Interactive version: theaggregate.ai/model?slug=gpt-5-6-luna-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.