Grok 4.1: benchmark results
xAI's Grok 4.1 model with improved conversational and emotional intelligence. Provider: xAI. Released 2025-11-17. Access: API.
Unified ELO 1636 ± 1, rank #160 of 1392 rated models, from 30 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| SnitchBench | 92.5 | Govt Contact Rate (%) | 100 |
| LiveMedBench | 28.28 | Overall Score (%) | 91.9 |
| Chatbot Arena (Text - Korean) | 1432 | Arena Score | 88.8 |
| Chatbot Arena (Text - English) | 1471 | Arena Score | 88.1 |
| Chatbot Arena (Text) | 1459 | Elo | 87 |
| Chatbot Arena (Text - German) | 1465 | Arena Score | 85.8 |
| Chatbot Arena (Text - Creative Writing) | 1431 | Arena Score | 84.8 |
| Chatbot Arena (Text - Hard Prompts) | 1474 | Arena Score | 83.7 |
| Chatbot Arena (Text - Chinese) | 1494 | Arena Score | 83.6 |
| Chatbot Arena (Text - Multi-Turn) | 1461 | Arena Score | 83.6 |
| Chatbot Arena (Text - Coding) | 1493 | Arena Score | 81.2 |
| Chatbot Arena (Text - Russian) | 1447 | Arena Score | 80.7 |
Interactive version: theaggregate.ai/model?slug=grok-4-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.