RPCBench - Domain - MIND-small - Evidence Faithfulness: leaderboard

Metric: Faithfulness Index (%). Source: github.com. Saturation forecast: Around December 2026. 11 models tracked.

Top models

#ModelScore
1Qwen 3.5 122B A10B86.42
2GPT-5.586.06
3Qwen 3.5 397B A17B86.06
4Qwen 3.5 35B A3B85.78
5Qwen 3.5 Plus83.93
6Gemini 3.1 Pro (Preview)79.37
7DeepSeek V4 Pro78.73
8DeepSeek V4 Flash76.88
9Claude Sonnet 4.672.05
10Llama 3.1 70B Instruct42.89
11Llama 3.1 8B Instruct33.14

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-domain-mind-small-evidence-faithfulness · How It Works · Data refreshed daily, snapshot 2026-09-24.