GPT-5.1 (2025-11-13) (High): benchmark results
Provider: OpenAI. Released 2025-11-12. Access: API.
Unified ELO 1756 ± 17, rank #221 of 2131 rated models, from 101 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - jaster (0-shot) - JCoLA (in-domain) | 84 | Exact match (%) | 99.3 |
| Vals AI MedQA | 96.38 | Accuracy (%) | 98.9 |
| Nejumi 4 - jaster (2-shot) - AIO | 96.18 | Character F1 (x100) | 98.6 |
| Vals AI CaseLaw v2 | 73.42 | Accuracy (%) | 98.3 |
| Nejumi 4 - jaster (2-shot) - JCoLA (in-domain) | 83 | Exact match (%) | 98.2 |
| Nejumi 4 - jaster (0-shot) - KUCI | 90 | Exact match (%) | 96.8 |
| Nejumi 4 - jaster (2-shot) - JCommonsenseQA | 100 | Exact match (%) | 94.7 |
| Nejumi 4 - jaster (2-shot) - MGSM | 94 | Exact match (%) | 94 |
| Nejumi 4 - jaster (0-shot) - ALT Japanese-to-English | 90.15 | COMET wmt22 (x100) | 93.3 |
| Nejumi 4 - jaster (0-shot) - MGSM | 93 | Exact match (%) | 92.9 |
| Nejumi 4 - jaster (2-shot) - JaMP | 81 | Exact match (%) | 92.9 |
| PLCC - Geography | 97 | Accuracy (%) | 92.2 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1-2025-11-13-high · How It Works · Data refreshed daily, snapshot 2026-10-09.