LLM Stats (Terminal-Bench 2.1): leaderboard

Metric: Score (%). Source: llm-stats.com. 35 models tracked.

Top models

#ModelScore
1Gemini 3.8 Flash89.4
2GPT-5.6 Sol88.8
3Muse Spark 1.388.8
4Kimi K388.3
5GLM-5.388.2
6DeepSeek V4 Pro (0813)87.9
7GPT-5.6 Terra87.4
8Qwen 3.8 Max86.6
9Gemini 3.7 Flash85.8
10Hy4 preview85.4
11GPT-5.6 Luna84.7
12Claude Fable 584.3
13GLM-5.3 Flash84.3
14DeepSeek-V4-Flash-Vision-Exp83.9
15Grok 4.583.3

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-terminal-bench-2-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.