SIS-Bench - Landmark Order: leaderboard

Metric: Accuracy (%; 306 landmark order questions; four-option multiple choice on UAV videos (at most 32 frames), zero-shot, open models through vLLM with at most 128 generated tokens and proprietary models through their APIs; higher is better). Source: arxiv.org. Saturation forecast: Estimated already saturated. 26 models tracked.

Top models

#ModelScore
1Kimi K2.598
2Qwen 3.5 Plus97.7
3Seed 1.896.1
4Qwen 3 VL 8B Instruct95.8
5Qwen 3 VL 8B (Thinking)95.1
6Qwen 3 VL 30B A3B Instruct95.1
7GPT-5.494.8
8InternVL3-14B94.8
9Gemini 3 Flash (Preview)94.4
10Step3 VL 10B94.1
11Qwen 3 VL 4B Instruct93.8
12GLM-4.1V-9B (Thinking)93.5
13InternVL3.5-8B86.3
14Qwen 2.5 VL 7B Instruct73.2
15Qwen 2 VL 7B Instruct71.6

Interactive version: theaggregate.ai/benchmark?slug=sis-bench-landmark-order · How It Works · Data refreshed daily, snapshot 2026-09-29.