MultiView-Bench - 3D DoF 3: leaderboard

Metric: Accuracy (%; six views, unconstrained object placement; fraction of 100 procedurally generated Blender scenes whose relative position of a target object is answered exactly as (+/-X or 0, +/-Y or 0, +/-Z or 0) in a visible world coordinate frame; mean over three runs where printed (Claude 3.7 Sonnet one run); x100). Source: arxiv.org. Saturation forecast: Around December 2026. 15 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Medium)63.3
2Gemini 3.5 Flash (Medium)54.3
3GPT-5.6 Terra (Medium)49.7
4GPT-549
5Gemini 3.1 Pro (Preview) (Medium)46.3
6GPT-5.6 Luna (Medium)45.7
7O334.2
8Claude Haiku 4.5 (Thinking)19
9Gemini 2.5 Pro17.7
10Gemini 2.5 Flash16
11Claude 3.7 Sonnet6
12Claude Sonnet 45.3
13GPT-4o2

Interactive version: theaggregate.ai/benchmark?slug=multiview-bench-3d-dof-3 · How It Works · Data refreshed daily, snapshot 2026-09-29.