RuVerBench - Deep Research: leaderboard

Metric: Balanced Accuracy (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview) (High)94.7
2Kimi K2.6 (Thinking)92.2
3Claude Opus 4.7 (Max)91.7
4GLM-5.1 (Thinking)91.5
5GPT-5.4 (xHigh)91.4
6DeepSeek V4 Pro (Max)90.8
7Qwen 3.6 Max (Preview) (Thinking)90.6
8DeepSeek V4 Flash (Max)90.2
9Qwen 3.5 27B (Thinking)89.8
10Claude Sonnet 4.6 (Max)89.4
11Qwen 3.5 122B A10B (Thinking)89.3
12Qwen 3.5 35B A3B (Thinking)89.3
13GPT-OSS-120B (High)88.9
14MiMo V2.5 Pro (Thinking)88.8
15Qwen 3.5 9B (Thinking)88.1

Interactive version: theaggregate.ai/benchmark?slug=ruverbench-deep-research · How It Works · Data refreshed daily, snapshot 2026-09-19.