MCSBench - L2: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)84.65
2GPT-581.94
3Gemini 3 Flash (Preview)81.72
4Claude Opus 4.679.46
5Gemini 2.5 Pro79.01
6GPT-5.277.43
7O4 Mini74.04
8Gemini 2.5 Flash73.14
9Qwen 3 VL 235B A22B (Thinking)71.56
10GPT-5 Mini71.33
11Qwen 3 VL 235B A22B Instruct68.62
12Qwen 3 VL 30B A3B Instruct66.59
13Qwen 2.5 VL 72B Instruct66.14
14Qwen 3 VL 30B A3B (Thinking)64.33
15Claude Sonnet 4.562.08

Interactive version: theaggregate.ai/benchmark?slug=mcsbench-l2 · How It Works · Data refreshed daily, snapshot 2026-09-19.