GPT-6 Sol (Medium): benchmark results
Provider: OpenAI. Access: API.
Unified ELO 1743 ± 1, rank #48 of 3363 rated models, from 59 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA GDP.pdf - Real Estate - Criterion Pass Rate | 79.65 | Criterion Pass Rate (%) | 99.4 |
| AA-Omniscience Index - Software Engineering (SWE) - HTML | 76 | Omniscience Index | 96.3 |
| AA-Omniscience Index - Software Engineering (SWE) - Java | 39 | Omniscience Index | 95.2 |
| AutomationBench-AA - Sales - Raw Objective Completion | 86.52 | Raw Objective Completion (%) | 95.2 |
| AA-Omniscience Index - Business | 22.5 | Omniscience Index | 95 |
| AA-Omniscience Index - Software Engineering (SWE) - TypeScript | 76.67 | Omniscience Index | 94.4 |
| Maze-Bench | 58.01 | Mean Score | 94.3 |
| AA-Omniscience Index - Software Engineering (SWE) - Go | 68 | Omniscience Index | 94.2 |
| AA-Omniscience Index - Software Engineering (SWE) - Python | 72 | Omniscience Index | 94.2 |
| AA Long Context Reasoning | 82.33 | Accuracy (%) | 94.1 |
| AA-Omniscience Index - Software Engineering (SWE) - Dart | 54 | Omniscience Index | 94.1 |
| AA-Omniscience Index - Software Engineering (SWE) - PHP | 66 | Omniscience Index | 94.1 |
Interactive version: theaggregate.ai/model?slug=gpt-6-sol-medium · How It Works · Data refreshed daily, snapshot 2026-09-23.