GPT-5.1: benchmark results
OpenAI's standard GPT-5.1 model with adaptive reasoning for general-purpose chat, coding, and writing. Provider: OpenAI. Released 2025-11-12. Access: API.
Unified ELO 1663 ± 1, rank #106 of 1392 rated models, from 562 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - data_narrative | 1.45 | Dataset z-score | 100 |
| Correction Suppression Benchmark | 89.6 | Suppression Rate (self-reported) | 100 |
| FactoryBench | 20.6 | Overall Score (self-reported) | 100 |
| Hebrew LLM - Summarization (Pairwise) | 65.98 | Pairwise Score (%) | 100 |
| PersonaArena | 3.96 | Average (self-reported) | 100 |
| StatABench | 68.6 | Total (self-reported) | 100 |
| MMMU Benchmark | 85.4 | Validation Score | 99.5 |
| Evals for Every Language - Language nb | 79.75 | Average Score (%) | 98.6 |
| Nejumi 4 - ALT - Truthfulness | 86.79 | Score (%) | 97.5 |
| LiveMedBench | 38.45 | Overall Score (%) | 97.3 |
| Evals for Every Language - Language ba | 67.97 | Average Score (%) | 97.1 |
| Evals for Every Language - Language bg | 74.89 | Average Score (%) | 97.1 |
Interactive version: theaggregate.ai/model?slug=gpt-5-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.