RPCBench - Error Group - Unverifiable Premise - Evidence Distortion: leaderboard

Metric: Evidence Distortion Rate (%). Source: github.com. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1GPT-5.53.63
2Qwen 3.5 397B A17B8.53
3Gemini 3.1 Pro (Preview)8.92
4Qwen 3.5 122B A10B9.8
5Qwen 3.5 35B A3B10.29
6Qwen 3.5 Plus10.39
7DeepSeek V4 Flash11.67
8DeepSeek V4 Pro12.06
9Llama 3.1 8B Instruct12.94
10Claude Sonnet 4.613.53
11Llama 3.1 70B Instruct17.45

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-error-group-unverifiable-premise-evidence-distortion · How It Works · Data refreshed daily, snapshot 2026-09-24.