Grok 4.6 (Medium): benchmark results

Provider: xAI. Released 2026-08-12. Access: API.

Unified ELO 1722 ± 1, rank #62 of 1761 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA GPQA Diamond93.54Accuracy (%)97.3
Artificial Analysis Intelligence Index48.39Intelligence Index96.5
AA Omniscience28Score95.5
AA GDPval1647.49ELO94.9
AA Humanity's Last Exam42.12Accuracy (%)92.8
AA Long Context Reasoning81Accuracy (%)92.6
Tau3 Banking44.33Success Rate (%)91.8
AA CritPt17.71Accuracy (%)90.9
AA Omniscience - Science, Engineering & Mathematics46.2Accuracy (%)89
AA Omniscience - Law38.2Accuracy (%)87.5
AA Omniscience - Software Engineering (SWE)64.9Accuracy (%)87
AA-Omniscience Accuracy41.93Accuracy (%)85.4

Interactive version: theaggregate.ai/model?slug=grok-4-6-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.