ComboShoppingBench - Response Quality: leaderboard

Metric: Pass rate (%; LLM-judged). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Claude Opus 4.8 (Thinking)96.6
2Gemini 3.1 Pro (Preview) (Thinking)93.8
3GPT-5.5 (Non-reasoning)93.1
4Kimi K2.6 (Thinking)92.8
5GPT-5.592.4
6Claude Opus 4.6 (Thinking)92.1
7GLM-5.2 (Non-reasoning)90.7
8Seed 2.0 Pro (Thinking)81.8
9Qwen 3.6 27B (Thinking)78.4
10Kimi K2.6 (Non-reasoning)75.6
11MiniMax M3 (Thinking)72.5
12Claude Sonnet 4.6 (Non-reasoning)68.4
13Claude Sonnet 4.6 (Thinking)59.8
14Qwen 3.6 27B (Non-reasoning)51.2
15Claude Opus 4.6 (Non-reasoning)19.6

Interactive version: theaggregate.ai/benchmark?slug=comboshoppingbench-response-quality · How It Works · Data refreshed daily, snapshot 2026-09-19.