GPT-6.1 Sol: benchmark results

Provider: OpenAI. Access: API.

Unified ELO 2035 ± 15, rank #3 of 1607 rated models, from 114 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA GDP.pdf - Construction - Criterion Pass Rate84.94Criterion Pass Rate (%)100
AA GDP.pdf - Criterion Pass Rate82.86Macro Criterion Pass Rate (%)100
AA GDP.pdf - Real Estate - Criterion Pass Rate81.5Criterion Pass Rate (%)100
Bug Hunt Bench - VS Code Extension24Planted Bugs Fixed (out of 45)100
EnigmaForge84.5Task success (%) over 600 procedurally generated story insta100
EnigmaForge - Fact F198.5World-fact recovery F1 (%) over 600 instances, all items100
EnigmaForge - Intuition83.8Task success (%) on implicit-condition instances, where the 100
Explicit Edit Benchmark100Explicit Edit Score v2 (%)100
LLM Stats (HealthBench Consensus)96Score (%)100
AA-Omniscience Index - Software Engineering (SWE) - Java77Omniscience Index99.8
AA-Omniscience Index - Software Engineering (SWE) - HTML92Omniscience Index99.7
AA-Omniscience Index - Software Engineering (SWE) - Julia92Omniscience Index99.6

Interactive version: theaggregate.ai/model?slug=gpt-6-1-sol · How It Works · Data refreshed daily, snapshot 2026-09-30.