Grok 4.1: benchmark results

xAI's Grok 4.1 model with improved conversational and emotional intelligence. Provider: xAI. Released 2025-11-17. Access: API.

Unified ELO 1636 ± 1, rank #160 of 1392 rated models, from 30 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SnitchBench92.5Govt Contact Rate (%)100
LiveMedBench28.28Overall Score (%)91.9
Chatbot Arena (Text - Korean)1432Arena Score88.8
Chatbot Arena (Text - English)1471Arena Score88.1
Chatbot Arena (Text)1459Elo87
Chatbot Arena (Text - German)1465Arena Score85.8
Chatbot Arena (Text - Creative Writing)1431Arena Score84.8
Chatbot Arena (Text - Hard Prompts)1474Arena Score83.7
Chatbot Arena (Text - Chinese)1494Arena Score83.6
Chatbot Arena (Text - Multi-Turn)1461Arena Score83.6
Chatbot Arena (Text - Coding)1493Arena Score81.2
Chatbot Arena (Text - Russian)1447Arena Score80.7

Interactive version: theaggregate.ai/model?slug=grok-4-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.