Grok 4.20: benchmark results

xAI Grok 4.20 flagship with a built-in four-agent collaborative council and a 2M-token context. Provider: xAI. Released 2026-03-10. Access: API.

Unified ELO 1653 ± 1, rank #123 of 1392 rated models, from 335 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Alpha Arena (Nof1)34.59Return (%)100
EpiBench33.6Accuracy (%)100
FutureSearch BTF-2 Calibration0Calibration Error100
REFUTE74.5Truth Score (accuracy + calibration, higher is better)100
Evals for Every Language - Language ku67.12Average Score (%)98.6
Evals for Every Language - Language mr73.46Average Score (%)98.6
Evals for Every Language - Language zu70.06Average Score (%)98.6
Evals for Every Language - Language ja70.46Average Score (%)97.1
Evals for Every Language - Language sq73.1Average Score (%)97.1
Agent-ValueBench7.8Authority (self-reported)96.2
Evals for Every Language - Language pam96.67Average Score (%)94.7
ForecastBench67.9Overall Score (higher is better)94.7

Interactive version: theaggregate.ai/model?slug=grok-4-20 · How It Works · Data refreshed daily, snapshot 2026-09-05.