VGenST-Bench - Macro Average: leaderboard

Metric: Macro-averaged circular accuracy (%) on VGenST-Bench base multiple-choice questions; unweighted mean across the twelve task scores, each task score macro-averaged over applicable QA types; each model receives 8 uniformly sampled video frames; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 15 models tracked.

Top models

#ModelScore
1Gemini 3 Flash85.6
2GPT-5.482.7
3Gemini 3.1 Flash Lite79.6
4Gemma 4 31B (IT)72.5
5Kimi K2.671.7
6Qwen 3.5 27B68.7
7Gemma 4 26B A4B (IT)67.5
8GPT-5.4 Mini67
9Qwen 3.5 9B66.8
10Qwen 3.5 4B64
11GPT-5.4 Nano56.8

Interactive version: theaggregate.ai/benchmark?slug=vgenst-bench-macro-average · How It Works · Data refreshed daily, snapshot 2026-10-09.