DAREBench - Text - Multi-Step: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 35 models tracked.

Top models

#ModelScore
1GPT-5.583.6
2Claude Opus 4.683.4
3MiMo-V2.582.5
4GPT-5.482.4
5MiMo-V2.5-Pro81.7
6DeepSeek V4 Pro80.9
7Gemini 3.5 Flash80.9
8Gemini 3.1 Pro (Preview)80.7
9GPT-5.4 Mini79.1
10Claude Opus 4.878.1
11MiniMax-M2.777.8
12Qwen 3.6 Plus77.7
13Qwen 3.5 Plus77.3
14Claude Sonnet 4.676.8
15Claude Haiku 4.576.7

Interactive version: theaggregate.ai/benchmark?slug=darebench-text-multi-step · How It Works · Data refreshed daily, snapshot 2026-09-19.