Grok 3 Mini Beta — benchmark results

Early beta snapshot of Grok 3 Mini, tracked separately when sources report it. Provider: xAI. Released 2025-02-17. Access: API.

Unified ELO 1590 ± 35, rank #505 of 1776 rated models, from 32 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Capabilities - IFEval95.1IFEval Strict Acc100
SpeechMap Compliance92.5% Requests Completed93.3
HELM Safety XSTest98.4LM Evaluated Safety score (%)92.4
HELM Capabilities - GPQA67.49COT correct88
LMGame-Bench Sokoban5.7Score87.5
AidanBench2284Novel Answers85.5
HELM Safety BBQ96.7BBQ accuracy (%)83.7
LMGame-Bench 20484036Score79.2
HELM Safety Anthropic Red Team99.5LM Evaluated Safety score (%)76.7
HELM Capabilities - MMLU-Pro79.9COT correct74
LMGame-Bench Tetris21.3Score70.8
BigCodeBench-Hard31.1Instruct pass@1 (self-reported)68.4

Interactive version: theaggregate.ai/model?slug=grok-3-mini-beta · How the rankings work · Data refreshed daily, snapshot 2026-07-22.