Grok 4.20 0309 (Reasoning) — benchmark results

March 9, 2026 Grok 4.20 snapshot evaluated with reasoning enabled. Provider: xAI. Released 2026-03-09. Access: API.

Unified ELO 1792 ± 17, rank #145 of 1776 rated models, from 90 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA IFBench82.93Accuracy (%)99.8
UGI Leaderboard64.23UGI Score99.4
AA TAU-2 Bench96.49Accuracy (%)97
AA Global-MMLU-Lite - Burmese88.83Accuracy (%)95.5
AA Global-MMLU-Lite - Italian92.75Accuracy (%)94.8
Vals AI AIME96.46Accuracy (%)94.7
AA Omniscience13.37Score93.8
AA Global-MMLU-Lite - Portuguese92.33Accuracy (%)93.3
UGI - Natural Intelligence52.75NatInt Score91.6
UGI - Writing55.26Writing Score91.6
AA GPQA Diamond88.48Accuracy (%)90.6
AA Global-MMLU-Lite - Hindi89.92Accuracy (%)90.5

Interactive version: theaggregate.ai/model?slug=grok-4-20-0309-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.