Grok 4.20 0309 (Reasoning): benchmark results

March 9, 2026 Grok 4.20 snapshot evaluated with reasoning enabled. Provider: xAI. Released 2026-03-09. Access: API.

Unified ELO 1629 ± 1, rank #322 of 1761 rated models, from 126 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA IFBench82.93Accuracy (%)99.8
UGI Leaderboard64.23UGI Score99.4
AA TAU-2 Bench96.49Accuracy (%)97
AA Global-MMLU-Lite - Burmese88.83Accuracy (%)95.5
Vals AI AIME96.46Accuracy (%)94.7
AA Global-MMLU-Lite - Italian92.75Accuracy (%)94.6
AA Global-MMLU-Lite - Portuguese92.33Accuracy (%)93.2
UGI - Natural Intelligence52.75NatInt Score90.9
UGI - Writing55.26Writing Score90.9
AA Global-MMLU-Lite - Hindi89.92Accuracy (%)90.1
Nejumi 4 - GLP - Abstract Reasoning81Score (%)89.3
AA Global-MMLU-Lite - English93.42Accuracy (%)89.2

Interactive version: theaggregate.ai/model?slug=grok-4-20-0309-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.