TUA-Bench: leaderboard
Metric: Success rate (%; mean of the verifier's scalar task reward over five runs of each of the 120 tasks; agent scaffold, model and reasoning effort as labelled). Source: arxiv.org. Saturation forecast: Around December 2026. 39 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5.5 (Codex, xHigh) | 64.7 |
Interactive version: theaggregate.ai/benchmark?slug=tua-bench · How It Works · Data refreshed daily, snapshot 2026-09-26.