GPT-5.1 (Non-reasoning): benchmark results

Provider: OpenAI. Released 2025-11-12. Access: API.

Unified ELO 1619 ± 1, rank #505 of 3078 rated models, from 126 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - Toxicity - Prohibited Acts97.92Criteria met (%)93.4
Nejumi 4 - jaster (2-shot) - ALT Japanese-to-English90.36COMET wmt22 (x100)91.9
Nejumi 4 - jaster (0-shot) - JCoLA (in-domain)80Exact match (%)91.2
Nejumi 4 - MT-Bench (Japanese) - STEM100Judge rating (1-10, x10)90.4
Nejumi 4 - jaster (2-shot) - ALT English-to-Japanese92.6COMET wmt22 (x100)89.7
AA Omniscience - Software Engineering (SWE) - Swift52Accuracy (%)86.7
Nejumi 4 - BFCL - Irrelevance Detection91.67Accuracy (%)86.4
AA Omniscience - Software Engineering (SWE) - Python34Accuracy (%)85.7
AA Omniscience - Software Engineering (SWE) - Julia28Accuracy (%)85.2
AA Omniscience - Software Engineering (SWE) - PHP40Accuracy (%)85.2
AA Omniscience - Software Engineering (SWE) - Java25Accuracy (%)84.6
Nejumi 4 - jaster (2-shot) - JaNLI100Exact match (%)84.2

Interactive version: theaggregate.ai/model?slug=gpt-5-1-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.