SiT-Bench - Navigation & Planning: leaderboard

Metric: Accuracy (%; item-weighted over the category's subtasks). Source: arxiv.org. Saturation forecast: Around January 2027. 31 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)77.11
2Qwen 3 VL 32B Instruct59.44
3Qwen 2.5 VL 72B Instruct55.67
4GPT-4o53.78
5Qwen 2.5 72B Instruct50.56
6DeepSeek V3.2 (Non-reasoning)49.89
7InternVL3-14B48.89
8Qwen 3 VL 4B Instruct47.44
9Qwen 3 4B (Non-reasoning)45.89
10Qwen 3 VL 8B Instruct45.78
11Qwen 2.5 3B Instruct45.44
12Llama 3.1 8B Instruct45.11
13Qwen 3 8B (Non-reasoning)45.11
14Qwen 3 4B 2507 Instruct44.22
15Qwen 2.5 VL 7B Instruct42.78

Interactive version: theaggregate.ai/benchmark?slug=sit-bench-navigation-planning · How It Works · Data refreshed daily, snapshot 2026-09-25.