ProactiveBench - ImageNet-C: leaderboard

Metric: Trajectory accuracy (%) on the corrupted ImageNet-C images: multi-turn multiple choice in which the model may name a category, abstain, or pick a proactive suggestion that yields a new frame, and a trajectory counts only when it ends in the correct category; samples a first-turn guess solves for at least 25% of the evaluated models are filtered out; higher is better. Source: arxiv.org. Saturation forecast: Around December 2027. 22 models tracked.

Top models

#ModelScoreOverall rank
1GPT-4.168.2#240
2O4 Mini49#172
3InternVL3-38B45.5#395
4Qwen 2.5 VL 7B Instruct40.5#643
5InternVL3-78B39.8#345
6InternVL3-8B37.7#606
7GPT-5.236.6#105
8Qwen 2.5 VL 32B Instruct30.9#443
9Phi-4 Multimodal Instruct29.8#896
10Qwen 2.5 VL 72B Instruct29.2#364

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=proactivebench-imagenet-c · How It Works · Data refreshed daily, snapshot 2026-10-11.