TRIP-Bench - Overall - Strict: leaderboard

Metric: Strict Success (%). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1GPT-5.2 (Thinking)18.5
2DeepSeek V3.2 (Thinking)10.5
3Claude Sonnet 4.5 (Thinking)8.5
4GLM-4.7 (Thinking)4
5Kimi K2 (Thinking)2.3
6DeepSeek V3.2 (Non-reasoning)2.3
7Claude Sonnet 4.5 (Non-reasoning)1.8
8Qwen 3 235B A22B 2507 Instruct0.5
9GPT-5.2 (Non-reasoning)0.5
10Qwen 3 235B A22B 2507 (Thinking)0
11Kimi K2 09050
12GLM-4.7 (Non-reasoning)0

Interactive version: theaggregate.ai/benchmark?slug=trip-bench-overall-strict · How It Works · Data refreshed daily, snapshot 2026-09-19.