MCSBench - L1: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)88.51
2GPT-587.36
3Claude Opus 4.686.21
4Gemini 2.5 Pro85.06
5Gemini 3 Flash (Preview)85.06
6Claude Sonnet 4.583.91
7Qwen 3 VL 235B A22B Instruct80.46
8Gemini 2.5 Flash77.01
9Qwen 2.5 VL 72B Instruct77.01
10GPT-5.275.86
11O4 Mini73.56
12Qwen 3 VL 235B A22B (Thinking)73.56
13Qwen 3 VL 30B A3B (Thinking)73.56
14Qwen 2.5 VL 32B Instruct72.41
15GPT-5 Mini71.26

Interactive version: theaggregate.ai/benchmark?slug=mcsbench-l1 · How It Works · Data refreshed daily, snapshot 2026-09-19.