Grok 4.20 Multi-Agent: benchmark results
xAI Grok 4.20 evaluated in multi-agent mode. Provider: xAI. Released 2026-03-09. Access: API.
Unified ELO 1704 ± 1, rank #50 of 1392 rated models, from 40 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| UGI Leaderboard | 70 | UGI Score | 100 |
| UGI - Writing | 63.13 | Writing Score | 94.3 |
| Bullshit Benchmark | 67.3 | BS Detection Rate (%) | 92.7 |
| Chatbot Arena (Text - German) | 1477 | Arena Score | 92.7 |
| UGI - Natural Intelligence | 56.34 | NatInt Score | 92.3 |
| Chatbot Arena (Text - Russian) | 1479 | Arena Score | 92 |
| Chatbot Arena (Text - Creative Writing) | 1448 | Arena Score | 90.7 |
| Chatbot Arena (Text) | 1470 | Elo | 90.5 |
| Chatbot Arena (Text - French) | 1492 | Arena Score | 90.4 |
| Chatbot Arena (Text - Korean) | 1436 | Arena Score | 90.2 |
| Chatbot Arena (Text - English) | 1473 | Arena Score | 89 |
| Chatbot Arena (Text - Multi-Turn) | 1473 | Arena Score | 88.7 |
Interactive version: theaggregate.ai/model?slug=grok-4-20-multi-agent · How It Works · Data refreshed daily, snapshot 2026-09-05.