OpenEvals - Terminal-Bench 2.0 — leaderboard

Metric: Success Rate (%). Source: huggingface.co. 17 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B52.5
2GLM-552.4
3Step 3.5 Flash51
4Qwen 3.5 122B A10B49.4
5Kimi K2.543.2
6Qwen 3.5 27B41.6
7Qwen 3.5 35B A3B40.5
8DeepSeek V3.239.6
9Qwen3 Coder Next36.2
10Kimi K2 (Thinking)35.7
11GLM-4.733.4
12NVIDIA-Nemotron-3-Super-120B-A12B-BF1631
13MiniMax-M230
14MiniMax-M2.129.2
15Kimi K227.8

Interactive version: theaggregate.ai/benchmark?slug=openevals-terminal-bench-2-0 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.