ComboShoppingBench - Rule-Based Validation: leaderboard

Metric: Pass rate (%; all four rule-based checks). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1GPT-5.583.8
2Gemini 3.1 Pro (Preview) (Thinking)82.8
3Claude Opus 4.6 (Non-reasoning)75.9
4Claude Opus 4.6 (Thinking)73.9
5Claude Opus 4.8 (Thinking)73.5
6Kimi K2.6 (Thinking)67.4
7Claude Sonnet 4.6 (Thinking)65.6
8Claude Sonnet 4.6 (Non-reasoning)65.3
9GLM-5.2 (Non-reasoning)57
10MiniMax M3 (Thinking)54
11Qwen 3.6 27B (Non-reasoning)49.1
12DeepSeek V4 Pro (Non-reasoning)48.8
13Seed 2.0 Pro (Thinking)46.4
14Kimi K2.6 (Non-reasoning)35.7
15GPT-5.5 (Non-reasoning)28.5

Interactive version: theaggregate.ai/benchmark?slug=comboshoppingbench-rule-based-validation · How It Works · Data refreshed daily, snapshot 2026-09-19.