Grok 4.20 Multi-Agent: benchmark results

xAI Grok 4.20 evaluated in multi-agent mode. Provider: xAI. Released 2026-03-09. Access: API.

Unified ELO 1704 ± 1, rank #50 of 1392 rated models, from 40 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI Leaderboard70UGI Score100
UGI - Writing63.13Writing Score94.3
Bullshit Benchmark67.3BS Detection Rate (%)92.7
Chatbot Arena (Text - German)1477Arena Score92.7
UGI - Natural Intelligence56.34NatInt Score92.3
Chatbot Arena (Text - Russian)1479Arena Score92
Chatbot Arena (Text - Creative Writing)1448Arena Score90.7
Chatbot Arena (Text)1470Elo90.5
Chatbot Arena (Text - French)1492Arena Score90.4
Chatbot Arena (Text - Korean)1436Arena Score90.2
Chatbot Arena (Text - English)1473Arena Score89
Chatbot Arena (Text - Multi-Turn)1473Arena Score88.7

Interactive version: theaggregate.ai/model?slug=grok-4-20-multi-agent · How It Works · Data refreshed daily, snapshot 2026-09-05.