TOC-Bench - Event Ordering: leaderboard

Metric: Event Ordering accuracy (%) on TOC-Bench (2,323 human-verified questions over 1,951 videos from Charades, Perception Test, OVIS and MOSE, grounded in per-frame object tracks and kept only when not answerable from text alone, single frames or shuffled frames), mostly 32 uniformly sampled frames, deterministic scoring of multiple-choice, statement-pair, numeric and ordering formats; higher is better. Source: arxiv.org. Saturation forecast: Around 2030. 23 models tracked.

Top models

#ModelScore
1GPT-5.524.8
2Kimi K2.622.9
3Seed 2.0 Lite21.9
4Gemini 3.1 Pro (Preview)17.1
5Grok 4.317.1
6GLM-5V Turbo17.1
7Gemini 3.1 Flash Lite (Preview)16.2
8Qwen 2.5 VL 7B14.3
9GPT-5.4 Mini11.4
10Qwen 3 VL 8B (Thinking)10.5
11MiniCPM-V-2.69.5
12MiMo-V2-Omni7.6
13InternVL3-8B5.7

Interactive version: theaggregate.ai/benchmark?slug=toc-bench-event-ordering · How It Works · Data refreshed daily, snapshot 2026-10-07.