RPCBench - Error Group - Inconsistent Premise - Evidence Faithfulness: leaderboard

Metric: Faithfulness Index (%). Source: github.com. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1Qwen 3.5 Plus93.47
2Qwen 3.5 397B A17B92.85
3Qwen 3.5 122B A10B92.66
4GPT-5.592.21
5Qwen 3.5 35B A3B90.6
6Gemini 3.1 Pro (Preview)89.29
7DeepSeek V4 Pro85.97
8DeepSeek V4 Flash84.92
9Claude Sonnet 4.684.49
10Llama 3.1 70B Instruct39.1
11Llama 3.1 8B Instruct32.16

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-error-group-inconsistent-premise-evidence-faithfulness · How It Works · Data refreshed daily, snapshot 2026-09-24.