GPT-5.1 — benchmark results

OpenAI's standard GPT-5.1 model with adaptive reasoning for general-purpose chat, coding, and writing. Provider: OpenAI. Released 2025-11-12. Access: API.

Unified ELO 1728 ± 7, rank #222 of 1776 rated models, from 500 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - data_narrative1.45Dataset z-score100
AutoBench4.49AutoBench Rank100
Correction Suppression Benchmark89.6Suppression Rate (self-reported)100
FactoryBench20.6Overall Score (self-reported)100
Hebrew LLM - Summarization (Pairwise)65.98Pairwise Score (%)100
PersonaArena3.96Average (self-reported)100
StatABench68.6Total (self-reported)100
MMMU Benchmark85.4Validation Score99.5
AA-LCR75Score (self-reported)99.4
Vals AI MedQA96.38Accuracy (%)98.9
Evals for Every Language - Language nb79.75Average Score (%)98.6
Vals AI CaseLaw v273.42Accuracy (%)98.3

Interactive version: theaggregate.ai/model?slug=gpt-5-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.