RealDataAgentBench — leaderboard

Data-science agent benchmark evaluating whether LLM agents solve real-data analysis tasks correctly and robustly across correctness, code quality, efficiency, and statistical validity.

Metric: Average DAB Score (%). Source: patibandlavenkatamanideep.github.io. Status: saturation imminent. 14 models tracked.

Top models

#ModelScore
1Claude Opus 4.888.89
2GPT-4.187.52
3GPT-4.1 Mini87.02
4Claude Sonnet 4.685.74
5GPT-4o85.13
6Claude Opus 4.684.62
7Grok 3 Mini82.69
8Claude Haiku 4.5 (20251001)80.05
9GPT-4o Mini78.49
10GPT-577.95
11Gemini 2.5 Flash66.21
12GPT-4.1 Nano62.37

Interactive version: theaggregate.ai/benchmark?slug=realdataagentbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.