TOC-Bench - Cross-Object Order: leaderboard

Metric: Cross-Object Order accuracy (%) on TOC-Bench (2,323 human-verified questions over 1,951 videos from Charades, Perception Test, OVIS and MOSE, grounded in per-frame object tracks and kept only when not answerable from text alone, single frames or shuffled frames), mostly 32 uniformly sampled frames, deterministic scoring of multiple-choice, statement-pair, numeric and ordering formats; higher is better. Source: arxiv.org. Saturation forecast: Around 2030. 23 models tracked.

Top models

#ModelScore
1Kimi K2.663.6
2GPT-5.563.1
3Grok 4.361
4Gemini 3.1 Pro (Preview)57.2
5GLM-5V Turbo56.1
6Seed 2.0 Lite52.9
7MiniCPM-V-2.652.4
8Qwen 3 VL 8B (Thinking)50.8
9GPT-5.4 Mini49.2
10Gemini 3.1 Flash Lite (Preview)48.1
11MiMo-V2-Omni47.6
12InternVL3-8B43.3
13Qwen 2.5 VL 7B43.3

Interactive version: theaggregate.ai/benchmark?slug=toc-bench-cross-object-order · How It Works · Data refreshed daily, snapshot 2026-10-07.