Flat-Pack Bench - Part Mating: leaderboard

Metric: Mate: decide whether two parts are connected in the final assembly, 87 questions; multiple-choice accuracy (%, regex exact match) on furniture-assembly videos from IMaW with one or two segmented visual-prompt frames, zero-shot with greedy decoding (GPT-5 at its default); each row is the model's best of up to six settings (key-frame or trimmed video, mixed-media, collage or concat visual prompt) chosen by overall micro-average accuracy, the paper's main-table protocol; higher is better. Source: arxiv.org. Saturation forecast: Not forecast. 30 models tracked.

Top models

#ModelScore
1Qwen 3 VL 4B (Thinking)59.77
2Qwen 3 VL 4B Instruct56.32
3Qwen 2.5 VL 32B Instruct54.02
4InternVL3-38B52.87
5Gemini 3.1 Pro (Preview)49.43
6GPT-549.43
7Qwen 3 VL 30B A3B Instruct49.43
8InternVL3-14B48.28
9Qwen 3 VL 32B (Thinking)47.13
10Qwen 3 VL 8B (Thinking)44.83
11Qwen 3 VL 235B A22B Instruct43.68
12Qwen 3 VL 32B Instruct42.53
13Qwen 2.5 VL 7B Instruct41.38
14Gemini 2.5 Flash40.23
15Gemini 2.5 Pro39.08

Interactive version: theaggregate.ai/benchmark?slug=flat-pack-bench-part-mating · How It Works · Data refreshed daily, snapshot 2026-10-07.