RPCBench - Conditional Strategy Quality: leaderboard

Metric: Strategy Quality (0-100). Source: arxiv.org. Saturation forecast: Around December 2026. 11 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B87.21
2Qwen 3.5 Plus86.91
3DeepSeek V4 Pro85.85
4Qwen 3.5 122B A10B85.33
5DeepSeek V4 Flash84.77
6Claude Sonnet 4.684.65
7Qwen 3.5 35B A3B83.46
8GPT-5.582.64
9Gemini 3.1 Pro (Preview)80.21
10Llama 3.1 70B Instruct59.26
11Llama 3.1 8B Instruct51.59

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-conditional-strategy-quality · How It Works · Data refreshed daily, snapshot 2026-09-24.