Grok 4.5: benchmark results

xAI's flagship Grok 4.5 model for reasoning and general tasks. Provider: xAI. Released 2026-07-08. Access: API.

Unified ELO 1715 ± 1, rank #35 of 1392 rated models, from 210 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BoundaryBench (NIST High)74.9Success Rate under NIST high policy (%)100
E-commerce Last Exam - E-commerce78.65Mean Reward (%)100
LLM Stats (Tau3 Banking)33Score (%)100
Long-Horizon Terminal-Bench50.5Mean Score (%)100
Nejumi 4 - ALT - Controllability94.73Score (%)100
UGI Leaderboard62.32UGI Score99.1
Conceptual Reasoning Index - Decision Theory (DTBench)94.22Chance-Corrected Score (0-100)97.9
Kagi LLM Benchmark83.5Accuracy (%)96.5
E-commerce Last Exam56.31Mean Reward (%)96.4
E-commerce Last Exam - Travel46.73Mean Reward (%)96.4
AI for Education Pedagogy - Secondary89.31Accuracy (%)96.2
ZeroEval GPQA Diamond93GPQA Diamond Score96.2

Interactive version: theaggregate.ai/model?slug=grok-4-5 · How It Works · Data refreshed daily, snapshot 2026-09-05.