Finding the Right Fit - TUA-Bench (OpenHands): leaderboard

Metric: Task score (%), OpenHands harness, high reasoning effort, one run per task over 120 tasks. Source: huggingface.co. Saturation forecast: Around 2029. 5 models tracked.

Top models

#ModelScore
1Claude Opus 5 (High)65.23
2GLM-5.3 (High)62.86
3GPT-6 Astra (High)61.01
4DeepSeek V4 Pro (High)56.49
5Kimi K3 (High)50.54

Interactive version: theaggregate.ai/benchmark?slug=finding-the-right-fit-tua-bench-openhands · How It Works · Data refreshed daily, snapshot 2026-10-05.