SiT-Bench - Multi-View & Geometric Reasoning: leaderboard

Metric: Accuracy (%; item-weighted over the category's subtasks). Source: arxiv.org. Saturation forecast: Around August 2027. 31 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)68.54
2GPT-4o54.55
3Qwen 2.5 VL 72B Instruct53.47
4Qwen 2.5 72B Instruct53.23
5Qwen 3 VL 8B Instruct48.44
6DeepSeek V3.2 (Non-reasoning)46.65
7InternVL3-8B46.41
8Qwen 3 30B A3B 2507 Instruct46.41
9Qwen 2.5 VL 7B Instruct46.29
10Qwen 2.5 7B Instruct45.81
11Qwen 3 VL 32B Instruct45.81
12Qwen 3 VL 4B Instruct45.81
13InternVL3-14B45.69
14Qwen 3 4B (Non-reasoning)43.06
15Qwen 3 8B (Non-reasoning)41.87

Interactive version: theaggregate.ai/benchmark?slug=sit-bench-multi-view-geometric-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-25.