GPT-6 Astra (Max): benchmark results

Provider: OpenAI. Released 2026-09-03. Access: API.

Unified ELO 2012 ± 9, rank #2 of 2072 rated models, from 214 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA-Omniscience Index - Software Engineering (SWE) - Go92Omniscience Index100
ARC-AGI-362.71Accuracy (%)100
Agent Arena - Praise vs Complaint34.7Praise vs Complaint (%)100
Agents on Rails53.3Successful Runs (%)100
BALROG BabaIsAI (LLM)100Progress (%)100
BALROG Crafter (LLM)76.8Progress (%)100
BALROG MiniHack (LLM)65Progress (%)100
BALROG NetHack (LLM)13.2Progress (%)100
Chatbot Arena (Image-to-WebDev)1733Arena Score100
Chess Puzzles (Epoch AI)72Accuracy (%)100
ComplexConstraints57.7Score (%)100
Design Arena (Agents - Web Apps)1397Elo100

Interactive version: theaggregate.ai/model?slug=gpt-6-astra-max · How It Works · Data refreshed daily, snapshot 2026-10-02.