Grok 4.20 Beta (0309) (Reasoning) — benchmark results

March 9, 2026 Grok 4.20 beta snapshot evaluated with reasoning enabled. Provider: xAI. Released 2026-03-09. Access: API.

Unified ELO 1653 ± 28, rank #360 of 1776 rated models, from 64 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval Bulgarian NLU - BG NER Bsnlp93.5Named entity recognition Score (%)100
EuroEval Catalan Knowledge84.78Knowledge Average Score (%)98.5
EuroEval Bulgarian Common Sense Reasoning76.13Common Sense Reasoning Average Score (%)97.9
EuroEval Croatian Knowledge84.05Knowledge Average Score (%)97.9
EuroEval Czech Knowledge100Knowledge Average Score (%)97.6
EuroEval Catalan Common Sense Reasoning70.28Common Sense Reasoning Average Score (%)96.4
EuroEval Czech Common Sense Reasoning79.96Common Sense Reasoning Average Score (%)96.2
EuroEval Albanian Knowledge86.06Knowledge Average Score (%)96.1
EuroEval Bulgarian Knowledge76.32Knowledge Average Score (%)95.9
EuroEval Croatian Common Sense Reasoning72.03Common Sense Reasoning Average Score (%)95.9
EuroEval Czech NLU - PONER63.6Named entity recognition Score (%)95.2
UGI Leaderboard53.16UGI Score94.9

Interactive version: theaggregate.ai/model?slug=grok-4-20-beta-0309-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.