Vals AI Terminal-Bench Science: leaderboard

Metric: Resolution Rate (%). Source: www.vals.ai. 26 models tracked.

Top models

#ModelScore
1GPT-665.71
2Claude Fable 5.134.29
3Claude Opus 522.86
4Muse Spark 1.3 (Max)14.29
5GPT-5.6 Sol12.86
6Claude Fable 512.86
7Claude Opus 4.810
8GPT-5.6 Terra10
9Gemini 3.8 Flash8.57
10Muse Spark 1.38.57
11GPT-5.6 Luna5.71
12Gemini 3.7 Flash5.71
13Gemini 3.5 Flash4.29
14GLM-5.34.29
15Grok 4.64.29

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-terminal-bench-science · How It Works · Data refreshed daily, snapshot 2026-09-19.