SIS-Bench - Action Recall: leaderboard

Metric: Accuracy (%; 804 action recall questions; four-option multiple choice on UAV videos (at most 32 frames), zero-shot, open models through vLLM with at most 128 generated tokens and proprietary models through their APIs; higher is better). Source: arxiv.org. Saturation forecast: Around June 2028. 26 models tracked.

Top models

#ModelScore
1Seed 1.859.2
2Kimi K2.553
3GPT-5.449.9
4Gemini 3 Flash (Preview)42.4
5Qwen 3.5 Plus42.4
6GLM-4.1V-9B (Thinking)34.8
7Qwen 3 VL 8B (Thinking)33.6
8Qwen 2 VL 7B Instruct33.3
9Qwen 3 VL 8B Instruct32.2
10InternVL3.5-8B31.8
11Qwen 2.5 VL 7B Instruct29.2
12Qwen 3 VL 4B Instruct29.1
13Step3 VL 10B28.6
14Qwen 3 VL 30B A3B Instruct28.4
15InternVL3-14B24.9

Interactive version: theaggregate.ai/benchmark?slug=sis-bench-action-recall · How It Works · Data refreshed daily, snapshot 2026-09-29.