MuseBench - Static Visual Arts (Single-Select): leaderboard

Metric: Static-visual-arts chance-adjusted accuracy (%): raw single-select accuracy minus the per-item chance baseline, rescaled so random guessing scores 0 and a correct answer 1; a negative value is worse than chance; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 28 models tracked.

Top models

#ModelScore
1Qwen 3.5 Plus64.36
2Claude Opus 4.658.51
3Qwen 3.5 397B A17B57.45
4GPT-5.454.24
5InternVL3-78B48.79
6Gemini 3.1 Pro (Preview)42.7
7Qwen2.5-Omni-7B40.76
8InternVL3-8B36.23
9Gemma 4 E4B32.55
10Kimi K2.524.05
11Grok 4.119.7
12GLM-4.5V-2.97

Interactive version: theaggregate.ai/benchmark?slug=musebench-static-visual-arts-single-select · How It Works · Data refreshed daily, snapshot 2026-09-29.