Grok 4.20 — benchmark results

xAI Grok 4.20 flagship with a built-in four-agent collaborative council and a 2M-token context. Provider: xAI. Released 2026-03-10. Access: API.

Unified ELO 1710 ± 10, rank #257 of 1776 rated models, from 335 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Alpha Arena (Nof1)34.59Return (%)100
Causal Sensitivity Score (CSS)47.3CSS (self-reported)100
FutureSearch BTF-2 Calibration0Calibration Error100
ForecastBench68.2Overall Score (higher is better)98.9
Evals for Every Language - Language ku67.12Average Score (%)98.6
Evals for Every Language - Language mr73.46Average Score (%)98.6
Evals for Every Language - Language zu70.06Average Score (%)98.6
Evals for Every Language - Language ja70.46Average Score (%)97.1
Evals for Every Language - Language sq73.1Average Score (%)97.1
Agent-ValueBench7.8Authority (self-reported)96.2
Evals for Every Language - Language pam96.67Average Score (%)94.7
Evals for Every Language - Language fa70.2Average Score (%)94.2

Interactive version: theaggregate.ai/model?slug=grok-4-20 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.