GroupToM-Bench - Belief: leaderboard

Metric: strict exact-match accuracy (%) over multi-select options (random 6.7) on Level 1 belief tracking (second-order and deeper beliefs under information asymmetry and deception), multiple choice; 240 multimodal multi-agent scenarios (scene image plus dialogue); higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 11 models tracked.

Top models

#ModelScore
1GPT-4o79.8
2Gemini 3 Pro78.9
3GPT-576.7
4Claude Haiku 4.575.1
5GPT-5 Mini70.4
6InternVL3.5-8B66.5
7Qwen 2.5 VL 7B Instruct65.8
8GPT-5 Nano63.3
9Qwen 2 VL 7B58.3

Interactive version: theaggregate.ai/benchmark?slug=grouptom-bench-belief · How It Works · Data refreshed daily, snapshot 2026-09-29.