VGenST-Bench - Micro Average: leaderboard

Metric: Micro-averaged circular accuracy (%) on VGenST-Bench base multiple-choice questions; sample-weighted mean across all questions; each model receives 8 uniformly sampled video frames; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 15 models tracked.

Top models

#ModelScore
1Gemini 3 Flash85.9
2GPT-5.482.7
3Gemini 3.1 Flash Lite79.6
4Gemma 4 31B (IT)72.5
5Kimi K2.671
6Qwen 3.5 27B68.3
7Gemma 4 26B A4B (IT)67.4
8GPT-5.4 Mini67.1
9Qwen 3.5 9B66.4
10Qwen 3.5 4B63.6
11GPT-5.4 Nano56.8

Interactive version: theaggregate.ai/benchmark?slug=vgenst-bench-micro-average · How It Works · Data refreshed daily, snapshot 2026-10-09.