MultiView-Bench - 3D DoF 1: leaderboard

Metric: Accuracy (%; six views, objects share the central object axis; fraction of 100 procedurally generated Blender scenes whose relative position of a target object is answered exactly as (+/-X or 0, +/-Y or 0, +/-Z or 0) in a visible world coordinate frame; mean over three runs where printed (Claude 3.7 Sonnet one run); x100). Source: arxiv.org. Saturation forecast: Around July 2027. 15 models tracked.

Top models

#ModelScore
1GPT-5.6 Luna (Medium)63.7
2Gemini 3.1 Pro (Preview) (Medium)56.3
3O352.3
4GPT-5.6 Sol (Medium)52.3
5GPT-5.6 Terra (Medium)42.7
6Claude 3.7 Sonnet42
7GPT-539.7
8Gemini 3.5 Flash (Medium)35
9GPT-4o27.3
10Gemini 2.5 Pro26
11Gemini 2.5 Flash21.7
12Claude Haiku 4.5 (Thinking)17
13Claude Sonnet 410.3

Interactive version: theaggregate.ai/benchmark?slug=multiview-bench-3d-dof-1 · How It Works · Data refreshed daily, snapshot 2026-09-29.