GPT-5.6 Sol (Codex): benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1859 ± 18, rank #48 of 1605 rated models, from 31 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
DrawAI-Bench - Fidelity94Fidelity score (0-100; rules and VLM rubric, strongest obser100
DrawAI-Bench - Fidelity - Connector96.8Fidelity score (0-100; rules and VLM rubric, strongest obser100
DrawAI-Bench - Fidelity - Global Visual89.6Fidelity score (0-100; rules and VLM rubric, strongest obser100
DrawAI-Bench - Fidelity - Image87.9Fidelity score (0-100; rules and VLM rubric, strongest obser100
DrawAI-Bench - Fidelity - Table98.2Fidelity score (0-100; rules and VLM rubric, strongest obser100
FormalTCS - Theorem Elicitation67.4LLM-rubric score (0-100) from a Qwen3.8-Max judge in QoderCL100
PatchEval-Verified83.91Pass@1 (%)100
DrawAI-Bench - Fidelity - Text95.7Fidelity score (0-100; rules and VLM rubric, strongest obser95.8
CliniCARE-Bench - Process Rubric Score80Process rubric score (%; GPT-5.5 judge)93.3
DrawAI-Bench - Editability - Image93Editability score (0-100; rules and VLM rubric, strongest ob91.7
DrawAI-Bench - Fidelity - Shape97.6Fidelity score (0-100; rules and VLM rubric, strongest obser91.7
VariantBench42.1Endpoint pass rate (%)88.3

Interactive version: theaggregate.ai/model?slug=gpt-5-6-sol-codex · How It Works · Data refreshed daily, snapshot 2026-09-26.