Grok 4.20 0309 (Non-reasoning): benchmark results

March 9, 2026 Grok 4.20 snapshot evaluated with reasoning disabled. Provider: xAI. Released 2026-03-09. Access: API.

Unified ELO 1552 ± 1, rank #627 of 1761 rated models, from 45 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI Leaderboard51.77UGI Score92.8
UGI - Writing47.15Writing Score87.1
UGI - Natural Intelligence40.76NatInt Score86.9
AA Humanity's Last Exam24.51Accuracy (%)76.7
AA Omniscience - Law21.4Accuracy (%)72.3
AA Global-MMLU-Lite - Portuguese89.58Accuracy (%)69.4
AA Global-MMLU-Lite - Spanish90Accuracy (%)69.4
AA Omniscience - Humanities & Social Sciences26.6Accuracy (%)68.5
AA Omniscience - Health25.43Accuracy (%)67.8
AA Omniscience - Software Engineering (SWE)35.14Accuracy (%)66.9
AA-Omniscience Accuracy26.05Accuracy (%)66.4
AA Global-MMLU-Lite - Burmese78.58Accuracy (%)64.9

Interactive version: theaggregate.ai/model?slug=grok-4-20-0309-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.