Grok 4.1 (Thinking): benchmark results

Provider: xAI. Released 2025-11-17. Access: API.

Unified ELO 1627 ± 1, rank #457 of 3081 rated models, from 61 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Chatbot Arena (Text - Medicine & Healthcare)1502Arena Score96.4
Chatbot Arena (Text - Polish)1487Arena Score93
Chatbot Arena (Text - Legal & Government)1477Arena Score89.6
Chatbot Arena (Text - Non-English)1453Arena Score88.5
Chatbot Arena (Text - Spanish)1465Arena Score88.3
Chatbot Arena (Text)1465Elo88.2
Chatbot Arena (Text - English)1472Arena Score87.9
Chatbot Arena (Text - Life, Physical & Social Science)1480Arena Score87.2
Chatbot Arena (Text - Software & IT Services)1496Arena Score86.8
Chatbot Arena (Text - Business, Management & Financial Ops)1460Arena Score86.7
Chatbot Arena (Text - Entertainment, Sports & Media)1434Arena Score86.7
Chatbot Arena (Text - Korean)1429Arena Score86.6

Interactive version: theaggregate.ai/model?slug=grok-4-1-thinking · How It Works · Data refreshed daily, snapshot 2026-09-21.