DexHoldem Policy Bench: leaderboard
Metric: Task completion rate (%; scene-preserving successes plus disruptive completions over 80 real-robot primitive trials (10 per pickup primitive, 5 per other primitive, 14 primitives) per policy, each policy trained as one multi-task policy on the 1,470 DexHoldem teleoperated demonstrations). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 9 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | π0.5 | 61.2 |
| 2 | π0 | 57.5 |
| 3 | RDT | 46.2 |
| 4 | DP (DINO) | 36.2 |
| 5 | DP-Transformer | 20 |
| 6 | RDT-small | 17.5 |
| 7 | ACT | 15 |
| 8 | BAKU | 12.5 |
| 9 | DP-UNet | 1.2 |
Interactive version: theaggregate.ai/benchmark?slug=dexholdem-policy-bench · How It Works · Data refreshed daily, snapshot 2026-09-26.