GPT-5.1 (2025-11-13) (High): benchmark results

Provider: OpenAI. Released 2025-11-12. Access: API.

Unified ELO 1756 ± 17, rank #221 of 2131 rated models, from 101 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - jaster (0-shot) - JCoLA (in-domain)84Exact match (%)99.3
Vals AI MedQA96.38Accuracy (%)98.9
Nejumi 4 - jaster (2-shot) - AIO96.18Character F1 (x100)98.6
Vals AI CaseLaw v273.42Accuracy (%)98.3
Nejumi 4 - jaster (2-shot) - JCoLA (in-domain)83Exact match (%)98.2
Nejumi 4 - jaster (0-shot) - KUCI90Exact match (%)96.8
Nejumi 4 - jaster (2-shot) - JCommonsenseQA100Exact match (%)94.7
Nejumi 4 - jaster (2-shot) - MGSM94Exact match (%)94
Nejumi 4 - jaster (0-shot) - ALT Japanese-to-English90.15COMET wmt22 (x100)93.3
Nejumi 4 - jaster (0-shot) - MGSM93Exact match (%)92.9
Nejumi 4 - jaster (2-shot) - JaMP81Exact match (%)92.9
PLCC - Geography97Accuracy (%)92.2

Interactive version: theaggregate.ai/model?slug=gpt-5-1-2025-11-13-high · How It Works · Data refreshed daily, snapshot 2026-10-09.