RPCBench - Error Group - Boundary-Violating Premise - Evidence Faithfulness: leaderboard

Metric: Faithfulness Index (%). Source: github.com. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1Qwen 3.5 Plus99.54
2Qwen 3.5 397B A17B99.2
3GPT-5.598.39
4Qwen 3.5 122B A10B98.17
5Qwen 3.5 35B A3B95.53
6Gemini 3.1 Pro (Preview)92.43
7Claude Sonnet 4.691.17
8DeepSeek V4 Pro82.22
9DeepSeek V4 Flash81.31
10Llama 3.1 70B Instruct70.64
11Llama 3.1 8B Instruct62.61

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-error-group-boundary-violating-premise-evidence-faithfulness · How It Works · Data refreshed daily, snapshot 2026-09-24.