LLM Stats (Terminal-Bench 2.1) — leaderboard

Metric: Score (%). Source: llm-stats.com. 15 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol88.8
2Kimi K388.3
3GPT-5.6 Terra87.4
4GPT-5.6 Luna84.7
5Claude Fable 584.3
6Grok 4.583.3
7GLM-5.282.7
8Muse Spark 1.180
9Gemini 3.6 Flash78
10Hy371.7
11Seed 2.1 Pro71
12MiniMax-M366
13Nemotron 3 Ultra56.4
14Gemini 3.5 Flash Lite54

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-terminal-bench-2-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.