Terminal-Bench Hard: leaderboard

Artificial Analysis Terminal-Bench hard subset for terminal-based software engineering, system administration, game-playing, and data-processing tasks.

Metric: Accuracy (%). Source: artificialanalysis.ai. Status: saturation imminent. 432 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)65.91
2GPT-5.6 Terra (xHigh)62.88
3GPT-5.6 Sol (Medium)62.88
4Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)62.88
5GPT-5.6 Sol (High)62.12
6GPT-5.6 Sol (xHigh)61.36
7GPT-5.5 (xHigh)60.61
8GPT-5.6 Sol (Low)60.61
9GPT-5.5 (High)59.85
10Claude Opus 4.8 (Adaptive Reasoning, Max Effort)58.33
11GPT-5.4 (xHigh)57.58
12GPT-5.6 Terra (Max)57.58
13GPT-5.5 (Medium)57.58
14GPT-5.6 Terra (High)57.58
15Claude Opus 4.7 (Non-reasoning, High)54.55

Interactive version: theaggregate.ai/benchmark?slug=terminal-bench-hard · How It Works · Data refreshed daily, snapshot 2026-09-05.