GPT-5.6 Luna (Medium) — benchmark results
GPT-5.6 Luna evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2026-07-09. Access: API.
Unified ELO 1818 ± 17, rank #127 of 1776 rated models, from 43 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Go | 70 | Accuracy (%) | 95.2 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 66 | Accuracy (%) | 94.6 |
| AA Omniscience - Software Engineering (SWE) - Python | 68.5 | Accuracy (%) | 92.6 |
| AA Omniscience - Software Engineering (SWE) - C | 76 | Accuracy (%) | 92 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 70.91 | Accuracy (%) | 91.9 |
| AA Omniscience - Software Engineering (SWE) - Rust | 76 | Accuracy (%) | 91.7 |
| AA Omniscience - Software Engineering (SWE) - Swift | 72 | Accuracy (%) | 91.7 |
| AA Omniscience - Software Engineering (SWE) - HTML | 70 | Accuracy (%) | 91.2 |
| AA Omniscience - Software Engineering (SWE) | 64 | Accuracy (%) | 91 |
| AA Omniscience - Software Engineering (SWE) - Dart | 50 | Accuracy (%) | 90.8 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 66.67 | Accuracy (%) | 90.4 |
| AA Omniscience - Software Engineering (SWE) - PHP | 64 | Accuracy (%) | 89.8 |
Interactive version: theaggregate.ai/model?slug=gpt-5-6-luna-medium · How the rankings work · Data refreshed daily, snapshot 2026-07-22.