MuseBench - Game Arts (Single-Select): leaderboard

Metric: Game-arts chance-adjusted accuracy (%): raw single-select accuracy minus the per-item chance baseline, rescaled so random guessing scores 0 and a correct answer 1; a negative value is worse than chance; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 28 models tracked.

Top models

#ModelScore
1Qwen 3.5 Plus38.8
2Gemini 3.1 Pro (Preview)38.72
3Qwen 3.5 397B A17B35.79
4Claude Opus 4.634.07
5GPT-5.432
6InternVL3-78B31.59
7Gemma 4 E4B10.3
8Qwen2.5-Omni-7B8.31
9InternVL3-8B6.66
10Grok 4.13.2
11Kimi K2.50.35
12GLM-4.5V-4.34

Interactive version: theaggregate.ai/benchmark?slug=musebench-game-arts-single-select · How It Works · Data refreshed daily, snapshot 2026-09-29.