MCSBench - L3: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)77.1
2Gemini 3 Flash (Preview)74.81
3GPT-561.07
4Claude Opus 4.653.44
5Gemini 2.5 Pro50.38
6GPT-5.242.75
7Gemini 2.5 Flash37.4
8O4 Mini35.11
9GPT-5 Mini34.35
10Claude Sonnet 4.532.06
11Qwen 3 VL 30B A3B (Thinking)32.06
12Gemma 3 12B (IT)29.77
13Qwen 3 VL 235B A22B Instruct28.24
14Qwen 2.5 VL 72B Instruct28.24
15InternVL3-14B27.48

Interactive version: theaggregate.ai/benchmark?slug=mcsbench-l3 · How It Works · Data refreshed daily, snapshot 2026-09-19.