Terminal-Bench 2.1 — leaderboard

State-of-the-art set of difficult terminal-based tasks.

Metric: Accuracy (%). Source: www.tbench.ai. Status: saturation imminent. 12 models tracked.

Top models

#ModelScore
1Claude Fable 583.8
2GPT-5.583.2
3Grok 4.579.3
4Claude Opus 4.878.9
5GPT-5.6 Terra78.4
6Muse Spark 1.176.2
7GPT-5.6 Luna75.7
8Claude Sonnet 574.6
9Gemini 3 Pro73.9
10Claude Opus 4.768.9
11Gemini 3.1 Pro (Preview)65.8
12GLM-5.158.6

Interactive version: theaggregate.ai/benchmark?slug=terminal-bench-2-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.