ComboShoppingBench - Overall Success: leaderboard

Metric: Pass rate (%; all judged and rule-based checks). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1GPT-5.561.2
2Gemini 3.1 Pro (Preview) (Thinking)50.2
3Claude Opus 4.6 (Thinking)49.8
4Claude Opus 4.8 (Thinking)49.5
5Kimi K2.6 (Thinking)44
6GLM-5.2 (Non-reasoning)30.2
7Claude Sonnet 4.6 (Thinking)27.8
8MiniMax M3 (Thinking)25.4
9Claude Sonnet 4.6 (Non-reasoning)23.4
10Seed 2.0 Pro (Thinking)17.5
11GPT-5.5 (Non-reasoning)14.4
12Kimi K2.6 (Non-reasoning)14.1
13Qwen 3.6 27B (Non-reasoning)12.4
14Claude Opus 4.6 (Non-reasoning)11.3
15Qwen 3.6 27B (Thinking)5.2

Interactive version: theaggregate.ai/benchmark?slug=comboshoppingbench-overall-success · How It Works · Data refreshed daily, snapshot 2026-09-19.