GPT-5.1 (Non-reasoning): benchmark results
Provider: OpenAI. Released 2025-11-12. Access: API.
Unified ELO 1619 ± 1, rank #505 of 3078 rated models, from 126 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - Toxicity - Prohibited Acts | 97.92 | Criteria met (%) | 93.4 |
| Nejumi 4 - jaster (2-shot) - ALT Japanese-to-English | 90.36 | COMET wmt22 (x100) | 91.9 |
| Nejumi 4 - jaster (0-shot) - JCoLA (in-domain) | 80 | Exact match (%) | 91.2 |
| Nejumi 4 - MT-Bench (Japanese) - STEM | 100 | Judge rating (1-10, x10) | 90.4 |
| Nejumi 4 - jaster (2-shot) - ALT English-to-Japanese | 92.6 | COMET wmt22 (x100) | 89.7 |
| AA Omniscience - Software Engineering (SWE) - Swift | 52 | Accuracy (%) | 86.7 |
| Nejumi 4 - BFCL - Irrelevance Detection | 91.67 | Accuracy (%) | 86.4 |
| AA Omniscience - Software Engineering (SWE) - Python | 34 | Accuracy (%) | 85.7 |
| AA Omniscience - Software Engineering (SWE) - Julia | 28 | Accuracy (%) | 85.2 |
| AA Omniscience - Software Engineering (SWE) - PHP | 40 | Accuracy (%) | 85.2 |
| AA Omniscience - Software Engineering (SWE) - Java | 25 | Accuracy (%) | 84.6 |
| Nejumi 4 - jaster (2-shot) - JaNLI | 100 | Exact match (%) | 84.2 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.