RPCBench - Error Group - Inconsistent Premise - Evidence Distortion: leaderboard

Metric: Evidence Distortion Rate (%). Source: github.com. Saturation forecast: Around December 2026. 11 models tracked.

Top models

#ModelScore
1GPT-5.59.91
2Qwen 3.5 Plus11.68
3Qwen 3.5 397B A17B12.91
4Qwen 3.5 122B A10B12.96
5Gemini 3.1 Pro (Preview)14.57
6Qwen 3.5 35B A3B16.23
7DeepSeek V4 Pro20.35
8DeepSeek V4 Flash20.51
9Claude Sonnet 4.620.73
10Llama 3.1 8B Instruct25.66
11Llama 3.1 70B Instruct28.92

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-error-group-inconsistent-premise-evidence-distortion · How It Works · Data refreshed daily, snapshot 2026-09-24.