Grok 4.20 0309 v2 (Reasoning): benchmark results

Provider: xAI. Released 2026-03-09. Access: API.

Unified ELO 1648 ± 1, rank #250 of 1761 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA IFBench81.22Accuracy (%)98.9
AA GPQA Diamond91.11Accuracy (%)91.7
AA Omniscience14.83Score89.8
AA TAU-2 Bench92.98Accuracy (%)89.1
AA Humanity's Last Exam34.52Accuracy (%)86.4
AA Terminal-Bench Hard37.88Accuracy (%)84.9
AA CritPt6.57Accuracy (%)81.4
Artificial Analysis Intelligence Index30.02Intelligence Index80.9
AA Omniscience - Software Engineering (SWE)42.9Accuracy (%)74.5
AA Omniscience - Science, Engineering & Mathematics35.6Accuracy (%)71.4
AA-Omniscience Accuracy27.48Accuracy (%)69.4
AA MMMU-Pro74.57Accuracy (%)68

Interactive version: theaggregate.ai/model?slug=grok-4-20-0309-v2-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.