Grok 4.20 Beta (0309) (Reasoning): benchmark results
March 9, 2026 Grok 4.20 beta snapshot evaluated with reasoning enabled. Provider: xAI. Released 2026-03-09. Access: API.
Unified ELO 1622 ± 1, rank #345 of 1761 rated models, from 93 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval Bulgarian NLU - BG NER Bsnlp | 93.5 | Named entity recognition Score (%) | 100 |
| EuroEval Catalan Knowledge | 84.78 | Knowledge Average Score (%) | 98.5 |
| EuroEval Bulgarian Common Sense Reasoning | 76.13 | Common Sense Reasoning Average Score (%) | 97.9 |
| EuroEval Croatian Knowledge | 84.05 | Knowledge Average Score (%) | 97.9 |
| EuroEval Czech Knowledge | 100 | Knowledge Average Score (%) | 97.6 |
| EuroEval Catalan Common Sense Reasoning | 70.28 | Common Sense Reasoning Average Score (%) | 96.4 |
| EuroEval Czech Common Sense Reasoning | 79.96 | Common Sense Reasoning Average Score (%) | 96.2 |
| EuroEval Albanian Knowledge | 86.06 | Knowledge Average Score (%) | 96.1 |
| EuroEval Bulgarian Knowledge | 76.32 | Knowledge Average Score (%) | 95.9 |
| EuroEval Croatian Common Sense Reasoning | 72.03 | Common Sense Reasoning Average Score (%) | 95.9 |
| EuroEval Czech NLU - PONER | 63.6 | Named entity recognition Score (%) | 95.2 |
| EuroEval Bosnian NLU - WikiANN BS | 76.5 | Named entity recognition Score (%) | 94.8 |
Interactive version: theaggregate.ai/model?slug=grok-4-20-beta-0309-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.