MMPCBench - Strategic Effectiveness: leaderboard

Metric: Judge-panel score (0-2; detected errors only). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.1 (High)1.95
2GPT-5 Mini1.93
3GPT-5.21.87
4Claude Sonnet 4.5 (Thinking)1.86
5Gemini 3 Pro1.79
6Gemini 3 Flash1.77
7Qwen 3 VL 235B A22B Instruct1.69
8GLM-4.6V1.69
9Qwen 3 VL 30B A3B Instruct1.57
10Qwen 3 VL 8B Instruct1.54
11Gemma 3 27B (IT)1.42
12Gemma 3 12B (IT)1.42
13Gemma 3 4B (IT)1.24

Interactive version: theaggregate.ai/benchmark?slug=mmpcbench-strategic-effectiveness · How It Works · Data refreshed daily, snapshot 2026-09-19.