GPT-5.1 (Low): benchmark results

GPT-5.1 evaluated at the low reasoning-effort setting. Provider: OpenAI. Released 2025-11-12. Access: API.

Unified ELO 1638 ± 1, rank #290 of 1761 rated models, from 24 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI - Natural Intelligence61.99NatInt Score94.7
UGI - Writing50.84Writing Score88.5
LLM Chess (Saplin)614.7ELO77.6
UGI Leaderboard44.15UGI Score77.6
Design Arena (Data Viz)1224Elo66
Epoch AI - Mystery Game Puzzles19Score57.3
FrontierMath - Tiers 1-317.3Accuracy (%, 290 problems)54.5
Chess Puzzles (Epoch AI)14Accuracy (%)50.7
Design Arena (Game Dev)1181Elo50.3
Inverse Turing Bench63.02Accuracy (self-reported)50
Design Arena (Website)1187Elo49.1
OTIS Mock AIME 2024-2563.89Accuracy (%)48.1

Interactive version: theaggregate.ai/model?slug=gpt-5-1-low · How It Works · Data refreshed daily, snapshot 2026-09-05.