Computer Anthology Terminal Tasks (Terminus-2): leaderboard

Metric: pass@1 (%). Source: vetto.ai. 28 models tracked.

Top models

#ModelScore
1GPT-6 (Medium)67
2Claude Fable 5.1 (High)62.4
3Claude Opus 5 (High)62
4Gemini 3.8 Flash (Medium)51.8
5GPT-5.6 Sol (Medium)51.6
6Claude Fable 5 (High)50.8
7Grok 4.6 (High)49.2
8Gemini 3.7 Flash (Medium)46
9Kimi K3 (Max)40
10Muse Spark 1.139
11GPT-5.5 (Medium)38.6
12DeepSeek V4 Pro (0813) (High)32.6
13GLM-5.2 (High)31.4
14Claude Opus 4.8 (High)29.8
15Qwen 3.8 Max (xHigh)26

Interactive version: theaggregate.ai/benchmark?slug=computer-anthology-terminal-tasks-terminus-2 · How It Works · Data refreshed daily, snapshot 2026-09-20.