AARRI-Bench (Claude Code): leaderboard

Metric: Task success rate (%) under the 0/1 reward (a task counts only when every one of its unit tests passes) over the 82 hand-crafted AI-research-intern tasks in four scenario categories; Harbor containerized runs, Claude Code agent harness; a configuration's tasks without a valid run are left out of its denominator; higher is better. Source: arxiv.org. Saturation forecast: Around November 2027. 6 models tracked.

Top models

#ModelScore
1Claude Opus 4.762.2
2Qwen 3.6 Plus56.3
3MiniMax-M2.756.1
4GPT-5.3 Codex53.1
5Claude Sonnet 4.652.4
6Kimi K2.651.3

Interactive version: theaggregate.ai/benchmark?slug=aarri-bench-claude-code · How It Works · Data refreshed daily, snapshot 2026-09-29.