DAREBench - Multimodal - Multi-Step with Tools: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1Claude Opus 4.861.8
2Claude Opus 4.648.1
3MiMo-V2.543
4GPT-5.542.4
5Claude Sonnet 4.642.3
6Qwen 3.6 Plus41.2
7GPT-5.440.3
8Qwen 3.5 Plus39.1
9Kimi K2.538.7
10Qwen 3.6 27B38.5
11GPT-5.4 Mini35.9
12MiMo-V2-Omni34.7
13Gemini 3.1 Pro (Preview)32.7
14Qwen 3.6 35B A3B32.7
15Claude Haiku 4.531.6

Interactive version: theaggregate.ai/benchmark?slug=darebench-multimodal-multi-step-with-tools · How It Works · Data refreshed daily, snapshot 2026-09-19.