AgentVidBench (Single-Turn): leaderboard

Metric: Accuracy (%; 100 human-authored multi-hop multiple-choice questions over 71 openly licensed videos, each with the answer and 25 distractors, scored by exact option match; single pass without tools, 1 fps frame sampling except GPT-5 and Claude Opus 4.7 at 50 frames because of their API input limits). Source: arxiv.org. Saturation forecast: Around 2029. 20 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro51
2Gemini 2.5 Flash46
3Gemma 4 31B38
4Gemma 4 31B (Reasoning)37
5Claude Opus 4.730
6GPT-529
7Qwen 3.5 27B (Thinking)25
8Qwen 3.5 9B (Thinking)22
9Qwen 3.5 27B (Non-reasoning)22
10Gemma 4 26B A4B (Reasoning)22
11Gemma 4 26B A4B21
12Qwen 3.5 9B (Non-reasoning)19
13Qwen 3 VL 8B Instruct18
14Qwen 3 VL 8B (Thinking)18
15Qwen 3 VL 4B (Thinking)18

Interactive version: theaggregate.ai/benchmark?slug=agentvidbench-single-turn · How It Works · Data refreshed daily, snapshot 2026-09-26.