TUA-Bench: leaderboard

Metric: Success rate (%; mean of the verifier's scalar task reward over five runs of each of the 120 tasks; agent scaffold, model and reasoning effort as labelled). Source: arxiv.org. Saturation forecast: Around December 2026. 39 models tracked.

Top models

#ModelScore
1GPT-5.5 (Codex, xHigh)64.7

Interactive version: theaggregate.ai/benchmark?slug=tua-bench · How It Works · Data refreshed daily, snapshot 2026-09-26.