GroupToM-Bench - Group Tension: leaderboard

Metric: strict exact-match accuracy (%) over multi-select options (random 6.7) on Level 4 group tension detection (false consensus and latent subgroup antagonism), multiple choice; 240 multimodal multi-agent scenarios (scene image plus dialogue); higher is better. Source: arxiv.org. Saturation forecast: Around September 2027. 11 models tracked.

Top models

#ModelScore
1Gemini 3 Pro53.1
2GPT-550.5
3GPT-4o50.3
4Claude Haiku 4.550.2
5GPT-5 Mini49.4
6GPT-5 Nano38
7Qwen 2.5 VL 7B Instruct36.4
8InternVL3.5-8B33.1
9Qwen 2 VL 7B26.2

Interactive version: theaggregate.ai/benchmark?slug=grouptom-bench-group-tension · How It Works · Data refreshed daily, snapshot 2026-09-29.