GPT-6 Astra (Max): benchmark results
Provider: OpenAI. Released 2026-09-03. Access: API.
Unified ELO 2012 ± 9, rank #2 of 2072 rated models, from 214 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA-Omniscience Index - Software Engineering (SWE) - Go | 92 | Omniscience Index | 100 |
| ARC-AGI-3 | 62.71 | Accuracy (%) | 100 |
| Agent Arena - Praise vs Complaint | 34.7 | Praise vs Complaint (%) | 100 |
| Agents on Rails | 53.3 | Successful Runs (%) | 100 |
| BALROG BabaIsAI (LLM) | 100 | Progress (%) | 100 |
| BALROG Crafter (LLM) | 76.8 | Progress (%) | 100 |
| BALROG MiniHack (LLM) | 65 | Progress (%) | 100 |
| BALROG NetHack (LLM) | 13.2 | Progress (%) | 100 |
| Chatbot Arena (Image-to-WebDev) | 1733 | Arena Score | 100 |
| Chess Puzzles (Epoch AI) | 72 | Accuracy (%) | 100 |
| ComplexConstraints | 57.7 | Score (%) | 100 |
| Design Arena (Agents - Web Apps) | 1397 | Elo | 100 |
Interactive version: theaggregate.ai/model?slug=gpt-6-astra-max · How It Works · Data refreshed daily, snapshot 2026-10-02.