AA Terminal-Bench Hard — leaderboard

Artificial Analysis independent evaluation of Terminal-Bench Hard: agentic terminal tasks including software engineering and system administration (44 tasks).

Metric: Accuracy (%). Source: artificialanalysis.ai. Status: saturation imminent. 432 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)65.91
2GPT-5.6 Terra (xHigh)62.88
3GPT-5.6 Sol (Medium)62.88
4GPT-5.6 Sol (High)62.12
5GPT-5.6 Sol (xHigh)61.36
6GPT-5.5 (xHigh)60.61
7GPT-5.6 Sol (Low)60.61
8GPT-5.5 (High)59.85
9Claude Opus 4.8 (Adaptive Reasoning, Max Effort)58.33
10GPT-5.4 (xHigh)57.58
11GPT-5.5 (Medium)57.58
12GPT-5.6 Terra (Max)57.58
13GPT-5.6 Terra (High)57.58
14Gemini 3.1 Pro (Preview)53.79
15Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)53.03

Interactive version: theaggregate.ai/benchmark?slug=aa-terminal-bench-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.