GPT-5.1 — benchmark results
OpenAI's standard GPT-5.1 model with adaptive reasoning for general-purpose chat, coding, and writing. Provider: OpenAI. Released 2025-11-12. Access: API.
Unified ELO 1728 ± 7, rank #222 of 1776 rated models, from 500 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - data_narrative | 1.45 | Dataset z-score | 100 |
| AutoBench | 4.49 | AutoBench Rank | 100 |
| Correction Suppression Benchmark | 89.6 | Suppression Rate (self-reported) | 100 |
| FactoryBench | 20.6 | Overall Score (self-reported) | 100 |
| Hebrew LLM - Summarization (Pairwise) | 65.98 | Pairwise Score (%) | 100 |
| PersonaArena | 3.96 | Average (self-reported) | 100 |
| StatABench | 68.6 | Total (self-reported) | 100 |
| MMMU Benchmark | 85.4 | Validation Score | 99.5 |
| AA-LCR | 75 | Score (self-reported) | 99.4 |
| Vals AI MedQA | 96.38 | Accuracy (%) | 98.9 |
| Evals for Every Language - Language nb | 79.75 | Average Score (%) | 98.6 |
| Vals AI CaseLaw v2 | 73.42 | Accuracy (%) | 98.3 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.