Grok 4.20 0309 (Non-reasoning) — benchmark results

March 9, 2026 Grok 4.20 snapshot evaluated with reasoning disabled. Provider: xAI. Released 2026-03-09. Access: API.

Unified ELO 1639 ± 19, rank #393 of 1776 rated models, from 59 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI Leaderboard51.77UGI Score92.9
UGI - Writing47.15Writing Score87.8
UGI - Natural Intelligence40.76NatInt Score87.6
AA Humanity's Last Exam22.52Accuracy (%)82.6
AA Omniscience - Software Engineering (SWE) - Java31Accuracy (%)80.7
AA Omniscience - Software Engineering (SWE) - Python35.5Accuracy (%)77
AA Omniscience - Law20.9Accuracy (%)76.3
AA Omniscience - Software Engineering (SWE) - PHP38Accuracy (%)72.8
AA Omniscience - Humanities & Social Sciences26.9Accuracy (%)72.3
AA Omniscience - Health25Accuracy (%)72.1
AA Omniscience - Software Engineering (SWE) - Kotlin28Accuracy (%)71.9
AA Omniscience - Software Engineering (SWE)34.7Accuracy (%)71

Interactive version: theaggregate.ai/model?slug=grok-4-20-0309-non-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.