AA Terminal-Bench 4.0: leaderboard

Metric: Pass@1 (%). Source: artificialanalysis.ai. Saturation forecast: Around January 2027. 216 models tracked.

Top models

#ModelScore
1GPT-6 Astra (xHigh)59.6
2GPT-6 Astra (Max)59.09
3Gemini 4 Argon (High)57.07
4GPT-6.1 Sol (Max)56.06
5GPT-6 Astra (High)54.04
6GPT-6.1 Sol (xHigh)54.04
7GPT-6.1 Sol (High)51.52
8GPT-6 Astra (Medium)49.49
9Claude Opus 5 (Max)48.99
10GPT-6.1 Sol (Medium)47.98
11Claude Opus 5 (xHigh)46.46
12Claude Opus 5 (High)45.96
13GPT-6 Sol (Max)43.94
14GLM-5.3 (Max)41.92
15GPT-6 Astra (Low)41.92

Interactive version: theaggregate.ai/benchmark?slug=aa-terminal-bench-4-0 · How It Works · Data refreshed daily, snapshot 2026-10-10.