AirGroundBench - Counterfactual Reasoning: leaderboard

Metric: Accuracy (%) on the counterfactual spatial-reasoning VQA task; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 13 models tracked.

Top models

#ModelScore
1Qwen 3.5 Plus48.57
2Qwen 3.5 397B A17B45.71
3GPT-5.244.93
4Seed 2.0 Pro44.62
5Claude Sonnet 4.644.35
6Gemini 3.1 Pro (Preview)43.42
7Qwen 3.5 27B43.25
8Kimi K2.540.3
9GLM-4.6V38.46
10ERNIE 5.035.82
11Qwen 3 VL 235B A22B35.38

Interactive version: theaggregate.ai/benchmark?slug=airgroundbench-counterfactual-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-29.