Grok 4.5 (Medium): benchmark results

Provider: xAI. Released 2026-07-08. Access: API.

Unified ELO 1733 ± 1, rank #56 of 3078 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ObviousBench100Answer pass³ (%)97.7
PetriBench - MinimumTokenSteps (Hard)66.8Exact-Match Accuracy (%)88.6
DuelLab Overall47.9DuelLab Score80.3
ARC-AGI-187.17Accuracy (%)72
PetriBench - Deadlock (Hard)59Exact-Match Accuracy (%)71.4
PetriBench - Hard48.9Exact-Match Accuracy (%)71.4
PetriBench - Medium65Exact-Match Accuracy (%)68.6
ARC-AGI-252.64Accuracy (%)67.5
PetriBench - L4-Liveness (Hard)73.5Exact-Match Accuracy (%)65.7
PetriBench - Easy83.8Exact-Match Accuracy (%)62.9
DeepsecBench16.47Recall-weighted F2 score (%)62.2
PetriBench - ReachableMarkings (Hard)12Exact-Match Accuracy (%)60

Interactive version: theaggregate.ai/model?slug=grok-4-5-medium · How It Works · Data refreshed daily, snapshot 2026-09-20.