MCSBench - Overall: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)83.51
2Gemini 3 Flash (Preview)80.79
3GPT-578.37
4Claude Opus 4.675.19
5Gemini 2.5 Pro74.13
6GPT-5.270.35
7Gemini 2.5 Flash66.57
8O4 Mini66.26
9GPT-5 Mini63.69
10Qwen 3 VL 235B A22B (Thinking)62.63
11Qwen 3 VL 235B A22B Instruct62.18
12Qwen 2.5 VL 72B Instruct60.06
13Qwen 3 VL 30B A3B (Thinking)59.15
14Claude Sonnet 4.559
15Qwen 3 VL 30B A3B Instruct58.85

Interactive version: theaggregate.ai/benchmark?slug=mcsbench-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.