ProactBench: leaderboard

Metric: Overall Pass Rate (self-reported). Source: benchmarklist.com. 16 models tracked.

Top models

#ModelScore
1GPT-5.561.5
2Qwen 3.5 397B A17B52.5
3Claude Opus 4.751.9
4Gemini 3.1 Pro (Preview)50.4
5Qwen 3.5 9B48
6Kimi K2.647.5
7MiMo-V2.5-Pro44.9
8DeepSeek V4 Flash44.3
9Gemini 2.5 Pro42.5
10O4 Mini38.6
11Gemini 2.5 Flash35.3
12GPT-4o20.5
13Llama 4 Maverick13.1
14Qwen 2.5 7B Instruct11.5
15Qwen 3 1.7B10.3

Interactive version: theaggregate.ai/benchmark?slug=proactbench · How It Works · Data refreshed daily, snapshot 2026-09-05.