Grok 4.1 (Thinking): benchmark results
Provider: xAI. Released 2025-11-17. Access: API.
Unified ELO 1627 ± 1, rank #457 of 3081 rated models, from 61 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Chatbot Arena (Text - Medicine & Healthcare) | 1502 | Arena Score | 96.4 |
| Chatbot Arena (Text - Polish) | 1487 | Arena Score | 93 |
| Chatbot Arena (Text - Legal & Government) | 1477 | Arena Score | 89.6 |
| Chatbot Arena (Text - Non-English) | 1453 | Arena Score | 88.5 |
| Chatbot Arena (Text - Spanish) | 1465 | Arena Score | 88.3 |
| Chatbot Arena (Text) | 1465 | Elo | 88.2 |
| Chatbot Arena (Text - English) | 1472 | Arena Score | 87.9 |
| Chatbot Arena (Text - Life, Physical & Social Science) | 1480 | Arena Score | 87.2 |
| Chatbot Arena (Text - Software & IT Services) | 1496 | Arena Score | 86.8 |
| Chatbot Arena (Text - Business, Management & Financial Ops) | 1460 | Arena Score | 86.7 |
| Chatbot Arena (Text - Entertainment, Sports & Media) | 1434 | Arena Score | 86.7 |
| Chatbot Arena (Text - Korean) | 1429 | Arena Score | 86.6 |
Interactive version: theaggregate.ai/model?slug=grok-4-1-thinking · How It Works · Data refreshed daily, snapshot 2026-09-21.