DAREBench - Multimodal - Multi-Step: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)88.5
2Claude Opus 4.676.2
3GPT-5.575
4GPT-5.471.2
5Claude Opus 4.869.2
6Qwen 3.5 Plus69.2
7MiMo-V2.566.7
8Qwen 3.6 Plus61.5
9Claude Sonnet 4.659.6
10Qwen 3.6 35B A3B57.7
11Gemma 4 26B A4B (IT)55.8
12Qwen 3.6 27B55.8
13Kimi K2.554.4
14Qwen 3.5 27B53.8
15Gemini 3.5 Flash50

Interactive version: theaggregate.ai/benchmark?slug=darebench-multimodal-multi-step · How It Works · Data refreshed daily, snapshot 2026-09-19.