TRIP-Bench - Overall - Loose: leaderboard

Metric: Loose Success (%). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1GPT-5.2 (Thinking)45
2DeepSeek V3.2 (Thinking)40
3Claude Sonnet 4.5 (Thinking)32
4GLM-4.7 (Thinking)20.3
5DeepSeek V3.2 (Non-reasoning)18.5
6Claude Sonnet 4.5 (Non-reasoning)17.3
7GLM-4.7 (Non-reasoning)14.8
8GPT-5.2 (Non-reasoning)13.3
9Kimi K2 (Thinking)10.8
10Qwen 3 235B A22B 2507 Instruct5.8
11Kimi K2 09053.3
12Qwen 3 235B A22B 2507 (Thinking)0

Interactive version: theaggregate.ai/benchmark?slug=trip-bench-overall-loose · How It Works · Data refreshed daily, snapshot 2026-09-19.