RPCBench - Error Group - Underspecified Premise - Evidence Distortion: leaderboard

Metric: Evidence Distortion Rate (%). Source: github.com. Saturation forecast: Around 2030. 11 models tracked.

Top models

#ModelScore
1Llama 3.1 8B Instruct27.77
2Llama 3.1 70B Instruct29.23
3Gemini 3.1 Pro (Preview)33.46
4GPT-5.540.38
5Claude Sonnet 4.643.08
6Qwen 3.5 35B A3B47.15
7Qwen 3.5 122B A10B48.31
8DeepSeek V4 Flash48.69
9DeepSeek V4 Pro48.92
10Qwen 3.5 397B A17B49.38
11Qwen 3.5 Plus51.08

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-error-group-underspecified-premise-evidence-distortion · How It Works · Data refreshed daily, snapshot 2026-09-24.