GPT-5.1: benchmark results

OpenAI's standard GPT-5.1 model with adaptive reasoning for general-purpose chat, coding, and writing. Provider: OpenAI. Released 2025-11-12. Access: API.

Unified ELO 1663 ± 1, rank #106 of 1392 rated models, from 562 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - data_narrative1.45Dataset z-score100
Correction Suppression Benchmark89.6Suppression Rate (self-reported)100
FactoryBench20.6Overall Score (self-reported)100
Hebrew LLM - Summarization (Pairwise)65.98Pairwise Score (%)100
PersonaArena3.96Average (self-reported)100
StatABench68.6Total (self-reported)100
MMMU Benchmark85.4Validation Score99.5
Evals for Every Language - Language nb79.75Average Score (%)98.6
Nejumi 4 - ALT - Truthfulness86.79Score (%)97.5
LiveMedBench38.45Overall Score (%)97.3
Evals for Every Language - Language ba67.97Average Score (%)97.1
Evals for Every Language - Language bg74.89Average Score (%)97.1

Interactive version: theaggregate.ai/model?slug=gpt-5-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.