Finding the Right Fit - Terminal-Bench 4 (63 Tasks, OpenHands): leaderboard

Metric: Task score (%), OpenHands harness, high reasoning effort, one run per task over 63 tasks. Source: huggingface.co. Saturation forecast: Around April 2027. 5 models tracked.

Top models

#ModelScore
1Claude Opus 5 (High)57.14
2GPT-6 Astra (High)49.21
3GLM-5.3 (High)41.27
4Kimi K3 (High)11.11
5DeepSeek V4 Pro (High)3.17

Interactive version: theaggregate.ai/benchmark?slug=finding-the-right-fit-terminal-bench-4-63-tasks-openhands · How It Works · Data refreshed daily, snapshot 2026-10-05.