Grok 3 Mini Beta — benchmark results
Early beta snapshot of Grok 3 Mini, tracked separately when sources report it. Provider: xAI. Released 2025-02-17. Access: API.
Unified ELO 1590 ± 35, rank #505 of 1776 rated models, from 32 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM Capabilities - IFEval | 95.1 | IFEval Strict Acc | 100 |
| SpeechMap Compliance | 92.5 | % Requests Completed | 93.3 |
| HELM Safety XSTest | 98.4 | LM Evaluated Safety score (%) | 92.4 |
| HELM Capabilities - GPQA | 67.49 | COT correct | 88 |
| LMGame-Bench Sokoban | 5.7 | Score | 87.5 |
| AidanBench | 2284 | Novel Answers | 85.5 |
| HELM Safety BBQ | 96.7 | BBQ accuracy (%) | 83.7 |
| LMGame-Bench 2048 | 4036 | Score | 79.2 |
| HELM Safety Anthropic Red Team | 99.5 | LM Evaluated Safety score (%) | 76.7 |
| HELM Capabilities - MMLU-Pro | 79.9 | COT correct | 74 |
| LMGame-Bench Tetris | 21.3 | Score | 70.8 |
| BigCodeBench-Hard | 31.1 | Instruct pass@1 (self-reported) | 68.4 |
Interactive version: theaggregate.ai/model?slug=grok-3-mini-beta · How the rankings work · Data refreshed daily, snapshot 2026-07-22.