KiloBench - Terminal Bench 2.0: leaderboard

Metric: Task completion in Kilo's agent harness, mean of 5 attempts (%). Source: kilo.ai. 37 models tracked.

Top models

#ModelScore
1GPT-679.33
2GPT-5.6 Sol76.18
3Claude Fable 5.176.18
4Gemini 3.8 Flash75.28
5DeepSeek V4.1 Flash75.28
6GPT-5.574.16
7Grok 4.673.03
8Kimi K372.81
9Claude Opus 571.46
10Claude Fable 571.01
11Grok 4.570.79
12Claude Opus 4.770.11
13Claude Opus 4.867.64
14Gemini 3.5 Flash64.72
15Kimi K2.7 Code60.67

Interactive version: theaggregate.ai/benchmark?slug=kilobench-terminal-bench-2-0 · How It Works · Data refreshed daily, snapshot 2026-09-19.