GPT-5.5 (2026-04-23): benchmark results
Provider: OpenAI. Released 2026-04-23. Access: API.
Unified ELO 1872 ± 14, rank #22 of 1639 rated models, from 157 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Embodied-BenchForge - Embodied QA | 73.64 | Accuracy (%, 220 interactive tasks) | 100 |
| Embodied-BenchForge - Static Scene | 57.67 | Mean Accuracy (%, six Offline EQA benchmarks) | 100 |
| Embodied-BenchForge - Success Rate | 83.18 | Success Rate (%, 220 interactive tasks) | 100 |
| HELM Robo-Reward-Bench - Droid | 0.39 | Absolute Error | 100 |
| IFHierBench | 53.7 | Prompt-level strict accuracy (%; share of prompts whose resp | 100 |
| IFHierBench - Instruction-Level | 65.3 | Instruction-level strict accuracy (%; share of individual co | 100 |
| IndicQE-APE - Segment-Level Quality Estimation | 0.62 | Macro Spearman correlation with human direct assessment (-1 | 100 |
| Interactive Visual Grounding (None) | 59.7 | Matcher accuracy (%; share of target items the model selects | 100 |
| Nejumi 4 - GLP - Basic Language | 87.8 | Score (%) | 100 |
| Nejumi 4 - GLP - Syntactic Analysis | 90 | Score (%) | 100 |
| Nejumi 4 - jaster (0-shot) | 88.02 | Score (%) | 100 |
| Nejumi 4 - jaster (2-shot) - ALT Japanese-to-English | 90.78 | COMET wmt22 (x100) | 100 |
Interactive version: theaggregate.ai/model?slug=gpt-5-5-2026-04-23 · How It Works · Data refreshed daily, snapshot 2026-10-09.