AA Terminal-Bench 2.1: leaderboard

Metric: Pass@1 (%). Source: artificialanalysis.ai. Saturation forecast: Around January 2027. 240 models tracked.

Top models

#ModelScore
1GPT-6 Astra (High)89.89
2GPT-5.6 Sol (xHigh)89.51
3GPT-6 Astra (Medium)89.51
4Claude Opus 5 (Max)89.14
5GPT-6 Astra (xHigh)89.14
6Qwen 3.8 Max (0902)88.76
7GPT-6 Astra (Max)88.39
8Grok 4.6 (High)88.39
9GPT-5.6 Sol (Max)88.01
10GPT-5.6 Terra (Max)88.01
11Grok 4.6 (xHigh)88.01
12Claude Opus 5 (xHigh)88.01
13GPT-6 Astra (Low)88.01
14Gemini 3.8 Flash (High)87.64
15Claude Opus 5 (High)87.64

Interactive version: theaggregate.ai/benchmark?slug=aa-terminal-bench-2-1 · How It Works · Data refreshed daily, snapshot 2026-10-10.