Grok 4.3 (High) — benchmark results

Grok 4.3 evaluated at the high reasoning-effort setting. Provider: xAI. Released 2026-04-30. Access: API.

Unified ELO 1824 ± 26, rank #119 of 1776 rated models, from 51 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA IFBench81.29Accuracy (%)99.1
AA TAU-2 Bench97.66Accuracy (%)97.9
AA Omniscience18.32Score96.4
AA GPQA Diamond90.1Accuracy (%)94.5
AA Humanity's Last Exam35.03Accuracy (%)93.1
AA Omniscience - Software Engineering (SWE) - C74Accuracy (%)90.5
AA SciCode47.34Accuracy (%)89.7
AA CritPt8Accuracy (%)89.2
AA Omniscience - Science, Engineering & Mathematics42.3Accuracy (%)88.7
Artificial Analysis Intelligence Index37.58Intelligence Index86.9
AA Omniscience - Software Engineering (SWE) - JavaScript58.18Accuracy (%)86.2
AA Omniscience - Software Engineering (SWE) - Rust70Accuracy (%)85.7

Interactive version: theaggregate.ai/model?slug=grok-4-3-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.