Grok 4 — benchmark results

xAI's flagship Grok 4 reasoning model with native tool use. Provider: xAI. Released 2025-07-09. Access: API.

Unified ELO 1729 ± 10, rank #221 of 1776 rated models, from 399 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Balrog43.6Score (self-reported)100
FinSearchComp68.9Average Score (%)100
LLM Emergent Collusion75Collusion Rate (%)100
LMGame-Bench Tetris125.7Score100
Medmarks - M-ARC80Score (%)100
Medmarks - MedConceptsQA Hard99.53Score (%)100
Medmarks - MedConceptsQA Medium99.82Score (%)100
OpenAI GPT-5 System Card - Molecular Biology Capabilities Test51.7Mean Accuracy (%)100
ProLLM - OpenBook Q&A94.4Score (%)100
RubberDuckBench69.29Performance (%)100
StereoTales304Emissions (self-reported)100
Vending-Bench4694.15Net Worth ($)100

Interactive version: theaggregate.ai/model?slug=grok-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.