GPT-5.5 (Non-reasoning): benchmark results
Provider: OpenAI. Released 2026-04-23. Access: API.
Unified ELO 1653 ± 1, rank #326 of 3078 rated models, from 87 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| RuleWeaver - Same-Source - Rubric Score | 53.83 | Judge rubric score (0-100) | 100 |
| RuleWeaver - Same-Source - Rule Precision | 74.58 | Correctly applied share of cited rules (%) | 100 |
| AA-Omniscience Index - Software Engineering (SWE) - TypeScript | 64.44 | Omniscience Index | 94.6 |
| UGI - Natural Intelligence | 62.57 | NatInt Score | 94.6 |
| AA Terminal-Bench Hard | 49.24 | Accuracy (%) | 94.5 |
| AA-Omniscience Index - Software Engineering (SWE) - Julia | 44 | Omniscience Index | 93 |
| AA-Omniscience Index - Software Engineering (SWE) - Kotlin | 42 | Omniscience Index | 92.3 |
| AA-Omniscience Index - Software Engineering (SWE) - Python | 53.5 | Omniscience Index | 91.5 |
| Wolfram LLM Benchmarking Project | 62.8 | Correct Functionality (%) | 91.5 |
| AA-Omniscience Index - Software Engineering (SWE) - PHP | 56 | Omniscience Index | 90.8 |
| PLCC - Culture & Tradition | 93 | Accuracy (%) | 90.7 |
| ComboShoppingBench - Response Quality | 93.1 | Pass rate (%; LLM-judged) | 90.5 |
Interactive version: theaggregate.ai/model?slug=gpt-5-5-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.