Vals AI Terminal-Bench 4.0: leaderboard

Metric: Accuracy (%). Source: www.vals.ai. 28 models tracked.

Top models

#ModelScore
1GPT-657.07
2Claude Fable 5.149.49
3Claude Opus 545.45
4GPT-5.6 Sol27.78
5Muse Spark 1.3 (Max)27.78
6GPT-5.6 Terra26.26
7GLM-5.325.25
8Qwen 3.8 Max24.75
9Claude Fable 522.73
10GLM-5.3 Flash19.7
11Grok 4.617.17
12Claude Opus 4.816.16
13Muse Spark 1.315.15
14Gemini 3.8 Flash13.13
15Kimi K312.63

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-terminal-bench-4-0 · How It Works · Data refreshed daily, snapshot 2026-09-19.