LLM Stats (Terminal-Bench 4.0): leaderboard

Metric: Score (%). Source: llm-stats.com. 13 models tracked.

Top models

#ModelScore
1GPT-657.7
2Claude Fable 5.155.8
3Claude Opus 551.8
4Claude Fable 544.5
5GLM-5.341.8
6GPT-5.6 Sol37.3
7Claude Opus 4.823.6
8GPT-5.6 Terra21.5
9Grok 4.620.3
10Gemini 3.8 Flash19.1
11GPT-5.6 Luna17.3
12Grok 4.512.4
13Claude Sonnet 512.4

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-terminal-bench-4-0 · How It Works · Data refreshed daily, snapshot 2026-09-05.