GPT-6 Luna (Max): benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1707 ± 1, rank #141 of 3363 rated models, from 89 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Long Context Reasoning83.33Accuracy (%)96.7
MLCR-AA - Accuracy93.75Accuracy (%)96.6
Artificial Analysis Intelligence Index37.26Intelligence Index90.9
AA CritPt19.43Accuracy (%)90.8
AA-Omniscience Index - Software Engineering (SWE) - JavaScript56.36Omniscience Index90.7
AA-Omniscience Index - Software Engineering (SWE) - Kotlin40Omniscience Index88.8
AA-Omniscience Index - Software Engineering (SWE) - Swift52Omniscience Index88.8
AA-Omniscience Index - Software Engineering (SWE) - Python50.5Omniscience Index88.5
AA Humanity's Last Exam38.51Accuracy (%)87.6
LiveBench Connections100Score87.1
AA-Omniscience Index - Software Engineering (SWE) - PHP48Omniscience Index86.7
AA-Omniscience Index - Software Engineering (SWE) - TypeScript46.67Omniscience Index86.2

Interactive version: theaggregate.ai/model?slug=gpt-6-luna-max · How It Works · Data refreshed daily, snapshot 2026-09-23.