GPT-6.1 Sol: benchmark results
Provider: OpenAI. Access: API.
Unified ELO 2035 ± 15, rank #3 of 1607 rated models, from 114 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA GDP.pdf - Construction - Criterion Pass Rate | 84.94 | Criterion Pass Rate (%) | 100 |
| AA GDP.pdf - Criterion Pass Rate | 82.86 | Macro Criterion Pass Rate (%) | 100 |
| AA GDP.pdf - Real Estate - Criterion Pass Rate | 81.5 | Criterion Pass Rate (%) | 100 |
| Bug Hunt Bench - VS Code Extension | 24 | Planted Bugs Fixed (out of 45) | 100 |
| EnigmaForge | 84.5 | Task success (%) over 600 procedurally generated story insta | 100 |
| EnigmaForge - Fact F1 | 98.5 | World-fact recovery F1 (%) over 600 instances, all items | 100 |
| EnigmaForge - Intuition | 83.8 | Task success (%) on implicit-condition instances, where the | 100 |
| Explicit Edit Benchmark | 100 | Explicit Edit Score v2 (%) | 100 |
| LLM Stats (HealthBench Consensus) | 96 | Score (%) | 100 |
| AA-Omniscience Index - Software Engineering (SWE) - Java | 77 | Omniscience Index | 99.8 |
| AA-Omniscience Index - Software Engineering (SWE) - HTML | 92 | Omniscience Index | 99.7 |
| AA-Omniscience Index - Software Engineering (SWE) - Julia | 92 | Omniscience Index | 99.6 |
Interactive version: theaggregate.ai/model?slug=gpt-6-1-sol · How It Works · Data refreshed daily, snapshot 2026-09-30.