DAREBench - Text - Single-Step: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 35 models tracked.

Top models

#ModelScore
1Claude Opus 4.898.8
2Gemini 3.1 Pro (Preview)96.4
3Qwen 3.6 Plus95.5
4Gemini 3.5 Flash94.9
5MiMo-V2.594.7
6GPT-5.594.1
7GPT-5.492.1
8MiMo-V2-Pro91.7
9DeepSeek V4 Pro91.6
10MiMo-V2.5-Pro91.6
11Claude Opus 4.691.5
12Qwen 3.5 Plus89.5
13Claude Sonnet 4.689.2
14Kimi K2.589.2
15Claude Haiku 4.589.1

Interactive version: theaggregate.ai/benchmark?slug=darebench-text-single-step · How It Works · Data refreshed daily, snapshot 2026-09-19.