RPCBench - Error Group - Unverifiable Premise - Evidence Faithfulness: leaderboard

Metric: Faithfulness Index (%). Source: github.com. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1GPT-5.595.93
2Qwen 3.5 122B A10B92.65
3Gemini 3.1 Pro (Preview)91.72
4Qwen 3.5 35B A3B91.62
5Qwen 3.5 Plus91.27
6Qwen 3.5 397B A17B91.03
7DeepSeek V4 Pro86.91
8DeepSeek V4 Flash81.42
9Claude Sonnet 4.672.25
10Llama 3.1 70B Instruct26.86
11Llama 3.1 8B Instruct21.37

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-error-group-unverifiable-premise-evidence-faithfulness · How It Works · Data refreshed daily, snapshot 2026-09-24.