GPT-5.1 (2025-11-13) (Non-reasoning): benchmark results

Provider: OpenAI. Released 2025-11-12. Access: API.

Unified ELO 1686 ± 21, rank #395 of 2133 rated models, from 81 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MATEO (Image+Text, Baseline)29Consistent temporal-execution-order accuracy (%) on MATEO's 100
MATEO (Image+Text, CoT)73Consistent temporal-execution-order accuracy (%) on MATEO's 100
MATEO (Image+Text, ICL)70Consistent temporal-execution-order accuracy (%) on MATEO's 100
MATEO (Image+Text, Self-Reflection)74Consistent temporal-execution-order accuracy (%) on MATEO's 100
MATEO (Image-only, CoT)71Consistent temporal-execution-order accuracy (%) on MATEO's 100
MATEO (Image-only, ICL)63Consistent temporal-execution-order accuracy (%) on MATEO's 100
MATEO (Image-only, Self-Reflection)71Consistent temporal-execution-order accuracy (%) on MATEO's 100
MATEO (Text-only, CoT)62Consistent temporal-execution-order accuracy (%) on MATEO's 100
MATEO (Text-only, Self-Reflection)62Consistent temporal-execution-order accuracy (%) on MATEO's 100
Nejumi 4 - Toxicity - Prohibited Acts97.92Criteria met (%)93.6
Nejumi 4 - jaster (2-shot) - ALT Japanese-to-English90.36COMET wmt22 (x100)92.2
Nejumi 4 - jaster (0-shot) - JCoLA (in-domain)80Exact match (%)91.5

Interactive version: theaggregate.ai/model?slug=gpt-5-1-2025-11-13-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-10-11.