MuseBench - Cinematic Arts (Single-Select): leaderboard

Metric: Cinematic-arts chance-adjusted accuracy (%): raw single-select accuracy minus the per-item chance baseline, rescaled so random guessing scores 0 and a correct answer 1; a negative value is worse than chance; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 28 models tracked.

Top models

#ModelScore
1Qwen 3.5 Plus68.88
2Claude Opus 4.663.26
3Qwen 3.5 397B A17B62.65
4GPT-5.456.5
5InternVL3-78B47.98
6InternVL3-8B43.41
7Gemini 3.1 Pro (Preview)43.16
8Gemma 4 E4B39.4
9Qwen2.5-Omni-7B36.47
10Kimi K2.523.06
11GLM-4.5V16.17
12Grok 4.114.19

Interactive version: theaggregate.ai/benchmark?slug=musebench-cinematic-arts-single-select · How It Works · Data refreshed daily, snapshot 2026-09-29.