Grok 2 (1212): benchmark results

December 12, 2024 xAI Grok 2 snapshot. Provider: xAI. Released 2024-12-12. Access: API.

Unified ELO 1546 ± 1, rank #454 of 1392 rated models, from 592 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Arcadia CommonsenseQA86.24Accuracy (%)100
OpenVLM MMT-Bench - CIM85Score (%)100
OpenVLM MMT-Bench - Image Dense Captioning94.7Score (%)100
OpenVLM MMT-Bench - Furniture Keypoint Detection80Score (%)99.8
OpenVLM MMT-Bench - Gesture Recognition85Score (%)99.8
OpenVLM MMT-Bench - VR88.1Score (%)99.5
OpenVLM MMT-Bench - Camouflage Object Detection85Score (%)99
OpenVLM MMT-Bench - Fashion Recognition90Score (%)99
OpenVLM MMT-Bench - Film and Television Recognition100Score (%)99
OpenVLM MMT-Bench - KD76Score (%)99
OpenVLM MMT-Bench - Loc73.5Score (%)99
OpenVLM MMT-Bench - Navigation95Score (%)99

Interactive version: theaggregate.ai/model?slug=grok-2-1212 · How It Works · Data refreshed daily, snapshot 2026-09-05.