GPT-5.1 (2025-11-13) (Non-reasoning): benchmark results
Provider: OpenAI. Released 2025-11-12. Access: API.
Unified ELO 1686 ± 21, rank #395 of 2133 rated models, from 81 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MATEO (Image+Text, Baseline) | 29 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| MATEO (Image+Text, CoT) | 73 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| MATEO (Image+Text, ICL) | 70 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| MATEO (Image+Text, Self-Reflection) | 74 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| MATEO (Image-only, CoT) | 71 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| MATEO (Image-only, ICL) | 63 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| MATEO (Image-only, Self-Reflection) | 71 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| MATEO (Text-only, CoT) | 62 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| MATEO (Text-only, Self-Reflection) | 62 | Consistent temporal-execution-order accuracy (%) on MATEO's | 100 |
| Nejumi 4 - Toxicity - Prohibited Acts | 97.92 | Criteria met (%) | 93.6 |
| Nejumi 4 - jaster (2-shot) - ALT Japanese-to-English | 90.36 | COMET wmt22 (x100) | 92.2 |
| Nejumi 4 - jaster (0-shot) - JCoLA (in-domain) | 80 | Exact match (%) | 91.5 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1-2025-11-13-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-10-11.