GPT-5 (Low): benchmark results

GPT-5 evaluated at the low reasoning-effort setting. Provider: OpenAI. Released 2025-08-07. Access: API.

Unified ELO 1642 ± 1, rank #273 of 1761 rated models, from 75 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Dart44Accuracy (%)97.8
FlagEval VQA - Geographic Reasoning70.2Score97.8
UGI - Natural Intelligence67.2NatInt Score96.7
AA Omniscience - Software Engineering (SWE) - Java37Accuracy (%)96.4
AA Omniscience - Software Engineering (SWE) - PHP54Accuracy (%)95.7
FlagEval VQA - Chart Understanding60.3Score95.7
FlagEval VQA - Subject Knowledge71.6Score95.7
AA Omniscience - Software Engineering (SWE) - Julia36Accuracy (%)94.5
AA Omniscience - Software Engineering (SWE) - Python44Accuracy (%)94.2
AA Omniscience - Software Engineering (SWE) - R38Accuracy (%)93.7
AA MMLU-Pro85.98Accuracy (%)93.4
GAIA2 - Ambiguity39.6Score (%)93.3

Interactive version: theaggregate.ai/model?slug=gpt-5-low · How It Works · Data refreshed daily, snapshot 2026-09-05.