MuseBench - Multi-Select (Overall): leaderboard

Metric: Overall exact-match accuracy (%) on multi-select questions; higher is better. Source: arxiv.org. Saturation forecast: Around 2033. 28 models tracked.

Top models

#ModelScore
1Claude Opus 4.628.91
2GPT-5.425.5
3Qwen 3.5 Plus23.21
4Qwen 3.5 397B A17B22.71
5InternVL3-8B20.3
6Qwen2.5-Omni-7B18.18
7Gemini 3.1 Pro (Preview)14.88
8InternVL3-78B13.53
9Gemma 4 E4B9.06
10GLM-4.5V8.61
11Grok 4.18
12Kimi K2.52.07

Interactive version: theaggregate.ai/benchmark?slug=musebench-multi-select-overall · How It Works · Data refreshed daily, snapshot 2026-09-29.