GPT-5.5 (2026-04-23): benchmark results

Provider: OpenAI. Released 2026-04-23. Access: API.

Unified ELO 1872 ± 14, rank #22 of 1639 rated models, from 157 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Embodied-BenchForge - Embodied QA73.64Accuracy (%, 220 interactive tasks)100
Embodied-BenchForge - Static Scene57.67Mean Accuracy (%, six Offline EQA benchmarks)100
Embodied-BenchForge - Success Rate83.18Success Rate (%, 220 interactive tasks)100
HELM Robo-Reward-Bench - Droid0.39Absolute Error100
IFHierBench53.7Prompt-level strict accuracy (%; share of prompts whose resp100
IFHierBench - Instruction-Level65.3Instruction-level strict accuracy (%; share of individual co100
IndicQE-APE - Segment-Level Quality Estimation0.62Macro Spearman correlation with human direct assessment (-1 100
Interactive Visual Grounding (None)59.7Matcher accuracy (%; share of target items the model selects100
Nejumi 4 - GLP - Basic Language87.8Score (%)100
Nejumi 4 - GLP - Syntactic Analysis90Score (%)100
Nejumi 4 - jaster (0-shot)88.02Score (%)100
Nejumi 4 - jaster (2-shot) - ALT Japanese-to-English90.78COMET wmt22 (x100)100

Interactive version: theaggregate.ai/model?slug=gpt-5-5-2026-04-23 · How It Works · Data refreshed daily, snapshot 2026-10-09.