Grok 4.20 Beta (0309) (Reasoning): benchmark results

March 9, 2026 Grok 4.20 beta snapshot evaluated with reasoning enabled. Provider: xAI. Released 2026-03-09. Access: API.

Unified ELO 1622 ± 1, rank #345 of 1761 rated models, from 93 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval Bulgarian NLU - BG NER Bsnlp93.5Named entity recognition Score (%)100
EuroEval Catalan Knowledge84.78Knowledge Average Score (%)98.5
EuroEval Bulgarian Common Sense Reasoning76.13Common Sense Reasoning Average Score (%)97.9
EuroEval Croatian Knowledge84.05Knowledge Average Score (%)97.9
EuroEval Czech Knowledge100Knowledge Average Score (%)97.6
EuroEval Catalan Common Sense Reasoning70.28Common Sense Reasoning Average Score (%)96.4
EuroEval Czech Common Sense Reasoning79.96Common Sense Reasoning Average Score (%)96.2
EuroEval Albanian Knowledge86.06Knowledge Average Score (%)96.1
EuroEval Bulgarian Knowledge76.32Knowledge Average Score (%)95.9
EuroEval Croatian Common Sense Reasoning72.03Common Sense Reasoning Average Score (%)95.9
EuroEval Czech NLU - PONER63.6Named entity recognition Score (%)95.2
EuroEval Bosnian NLU - WikiANN BS76.5Named entity recognition Score (%)94.8

Interactive version: theaggregate.ai/model?slug=grok-4-20-beta-0309-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.