Vals AI Terminal-Bench 2.1 — leaderboard

Metric: Accuracy (%). Source: www.vals.ai. 43 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol85.77
2Kimi K380.9
3Claude Fable 580.52
4GPT-5.6 Luna79.03
5GPT-5.576.4
6Claude Sonnet 574.53
7Gemini 3.5 Flash74.16
8Gemini 3.6 Flash73.78
9GPT-5.6 Terra73.41
10Claude Opus 4.871.91
11Gemini 3.1 Pro (Preview)70.79
12Muse Spark 1.169.29
13Claude Opus 4.768.54
14GLM-5.267.79
15Grok 4.567.79

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-terminal-bench-2-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.