GPT-5.6 Sol (Codex): benchmark results
Provider: OpenAI. Access: API.
Unified ELO 1859 ± 18, rank #48 of 1605 rated models, from 31 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| DrawAI-Bench - Fidelity | 94 | Fidelity score (0-100; rules and VLM rubric, strongest obser | 100 |
| DrawAI-Bench - Fidelity - Connector | 96.8 | Fidelity score (0-100; rules and VLM rubric, strongest obser | 100 |
| DrawAI-Bench - Fidelity - Global Visual | 89.6 | Fidelity score (0-100; rules and VLM rubric, strongest obser | 100 |
| DrawAI-Bench - Fidelity - Image | 87.9 | Fidelity score (0-100; rules and VLM rubric, strongest obser | 100 |
| DrawAI-Bench - Fidelity - Table | 98.2 | Fidelity score (0-100; rules and VLM rubric, strongest obser | 100 |
| FormalTCS - Theorem Elicitation | 67.4 | LLM-rubric score (0-100) from a Qwen3.8-Max judge in QoderCL | 100 |
| PatchEval-Verified | 83.91 | Pass@1 (%) | 100 |
| DrawAI-Bench - Fidelity - Text | 95.7 | Fidelity score (0-100; rules and VLM rubric, strongest obser | 95.8 |
| CliniCARE-Bench - Process Rubric Score | 80 | Process rubric score (%; GPT-5.5 judge) | 93.3 |
| DrawAI-Bench - Editability - Image | 93 | Editability score (0-100; rules and VLM rubric, strongest ob | 91.7 |
| DrawAI-Bench - Fidelity - Shape | 97.6 | Fidelity score (0-100; rules and VLM rubric, strongest obser | 91.7 |
| VariantBench | 42.1 | Endpoint pass rate (%) | 88.3 |
Interactive version: theaggregate.ai/model?slug=gpt-5-6-sol-codex · How It Works · Data refreshed daily, snapshot 2026-09-26.