GIM: leaderboard

Grounded Integration Measure from Meta FAIR: 820 multimodal and text-grounded problems requiring integrated reasoning across quantitative, spatial, language, world-knowledge, and document tasks.

Metric: IRT ability (theta). Source: arxiv.org. Status: saturation imminent. 46 models tracked.

Top models

#ModelScore
1GPT-5.4 Pro (xHigh)2.16
2Gemini 3.1 Pro (Preview) (High)2.04
3Gemini 3.1 Pro (Preview) (Medium)1.85
4GPT-5.4 (xHigh)1.64
5GPT-5.4 (High)1.59
6Claude Opus 4.7 (High)1.53
7Claude Opus 4.6 (High)1.48
8Gemini 3.1 Pro (Preview) (Low)1.45
9GPT-5.4 (Medium)1.39
10Claude Sonnet 4.6 (High)1.12
11GPT-5 (High)0.9
12Claude Sonnet 4.6 (Medium)0.84
13GPT-5.4 (Low)0.82
14GPT-5 (Medium)0.59
15Gemini 3.1 Flash Lite (High)0.1

Interactive version: theaggregate.ai/benchmark?slug=gim · How It Works · Data refreshed daily, snapshot 2026-09-05.