SIS-Bench - Landmark Recall: leaderboard

Metric: Accuracy (%; 443 landmark recall questions; four-option multiple choice on UAV videos (at most 32 frames), zero-shot, open models through vLLM with at most 128 generated tokens and proprietary models through their APIs; higher is better). Source: arxiv.org. Saturation forecast: Around December 2026. 26 models tracked.

Top models

#ModelScore
1Seed 1.884.4
2Gemini 3 Flash (Preview)84
3Qwen 3.5 Plus83.3
4Kimi K2.581.9
5InternVL3-14B79.7
6GPT-5.478.6
7Qwen 3 VL 8B (Thinking)78.6
8Qwen 3 VL 30B A3B Instruct76.5
9Qwen 3 VL 8B Instruct74.9
10Step3 VL 10B72.2
11InternVL3.5-8B72
12Qwen 3 VL 4B Instruct70.7
13GLM-4.1V-9B (Thinking)64.1
14Qwen 2 VL 7B Instruct58
15Qwen 2.5 VL 7B Instruct54.2

Interactive version: theaggregate.ai/benchmark?slug=sis-bench-landmark-recall · How It Works · Data refreshed daily, snapshot 2026-09-29.