Flat-Pack Bench - Part Tracking: leaderboard

Metric: Track: recover the correspondence of shuffled part IDs between two segmented frames using the video, 257 questions; multiple-choice accuracy (%, regex exact match) on furniture-assembly videos from IMaW with one or two segmented visual-prompt frames, zero-shot with greedy decoding (GPT-5 at its default); each row is the model's best of up to six settings (key-frame or trimmed video, mixed-media, collage or concat visual prompt) chosen by overall micro-average accuracy, the paper's main-table protocol; higher is better. Source: arxiv.org. Saturation forecast: Not forecast. 30 models tracked.

Top models

#ModelScore
1Qwen 3 VL 32B (Thinking)45.53
2Qwen 2.5 VL 72B Instruct45.14
3InternVL3-78B42.02
4Qwen 3 VL 30B A3B Instruct42.02
5Qwen 3 VL 235B A22B Instruct39.69
6InternVL3-14B37.74
7Qwen 3 VL 4B (Thinking)37.74
8Qwen 3 VL 8B Instruct33.85
9Qwen 2.5 VL 7B Instruct33.07
10Qwen 2.5 VL 32B Instruct33.07
11Qwen 3 VL 4B Instruct32.68
12Qwen 3 VL 32B Instruct31.91
13GPT-525.68
14InternVL3-38B25.68
15Qwen 3 VL 8B (Thinking)25.29

Interactive version: theaggregate.ai/benchmark?slug=flat-pack-bench-part-tracking · How It Works · Data refreshed daily, snapshot 2026-10-07.