ResearchClawBench: leaderboard

40 autonomous-research tasks in 10 scientific domains, each built from a published paper with its literature and data, scored on expert rubrics for re-discovering its findings; InternScience, 2026.

Metric: Overall (self-reported). Source: benchmarklist.com. Status: saturation imminent. 24 models tracked.

Top models

#ModelScore
1Claude Opus 4.720.7
2Claude Opus 4.619.9
3Qwen 3.7 Max18.7
4GLM-5.118.2
5Qwen 3.6 Plus18
6Kimi K2.618
7Gemini 3.5 Flash17.9
8DeepSeek V4 Pro17.1
9GPT-5.517
10MiMo-V2.516.9
11GPT-5.415.3
12MiMo-V2-Pro15.3
13Qwen 3.5 397B A17B14.2
14Kimi K2.514
15Grok 4.113.5

Interactive version: theaggregate.ai/benchmark?slug=researchclawbench · How It Works · Data refreshed daily, snapshot 2026-09-05.