Grok 4.20 Beta (0309) (Reasoning) — benchmark results
March 9, 2026 Grok 4.20 beta snapshot evaluated with reasoning enabled. Provider: xAI. Released 2026-03-09. Access: API.
Unified ELO 1653 ± 28, rank #360 of 1776 rated models, from 64 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval Bulgarian NLU - BG NER Bsnlp | 93.5 | Named entity recognition Score (%) | 100 |
| EuroEval Catalan Knowledge | 84.78 | Knowledge Average Score (%) | 98.5 |
| EuroEval Bulgarian Common Sense Reasoning | 76.13 | Common Sense Reasoning Average Score (%) | 97.9 |
| EuroEval Croatian Knowledge | 84.05 | Knowledge Average Score (%) | 97.9 |
| EuroEval Czech Knowledge | 100 | Knowledge Average Score (%) | 97.6 |
| EuroEval Catalan Common Sense Reasoning | 70.28 | Common Sense Reasoning Average Score (%) | 96.4 |
| EuroEval Czech Common Sense Reasoning | 79.96 | Common Sense Reasoning Average Score (%) | 96.2 |
| EuroEval Albanian Knowledge | 86.06 | Knowledge Average Score (%) | 96.1 |
| EuroEval Bulgarian Knowledge | 76.32 | Knowledge Average Score (%) | 95.9 |
| EuroEval Croatian Common Sense Reasoning | 72.03 | Common Sense Reasoning Average Score (%) | 95.9 |
| EuroEval Czech NLU - PONER | 63.6 | Named entity recognition Score (%) | 95.2 |
| UGI Leaderboard | 53.16 | UGI Score | 94.9 |
Interactive version: theaggregate.ai/model?slug=grok-4-20-beta-0309-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.