TOC-Bench - Relative Spatial Change: leaderboard

Metric: Relative Spatial Change accuracy (%) on TOC-Bench (2,323 human-verified questions over 1,951 videos from Charades, Perception Test, OVIS and MOSE, grounded in per-frame object tracks and kept only when not answerable from text alone, single frames or shuffled frames), mostly 32 uniformly sampled frames, deterministic scoring of multiple-choice, statement-pair, numeric and ordering formats; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 23 models tracked.

Top models

#ModelScore
1Grok 4.346.6
2Gemini 3.1 Pro (Preview)43.8
3GPT-5.543.8
4Kimi K2.643.8
5Seed 2.0 Lite38.2
6GLM-5V Turbo33.1
7Qwen 3 VL 8B (Thinking)30.3
8GPT-5.4 Mini28.7
9Gemini 3.1 Flash Lite (Preview)28.7
10MiMo-V2-Omni27
11InternVL3-8B26.4
12Qwen 2.5 VL 7B25.8
13MiniCPM-V-2.624.7

Interactive version: theaggregate.ai/benchmark?slug=toc-bench-relative-spatial-change · How It Works · Data refreshed daily, snapshot 2026-10-07.