RPCBench - Error Group - Unverifiable Premise - Fact Fabrication: leaderboard

Metric: Fact Fabrication Rate (%). Source: github.com. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1GPT-5.52.25
2Qwen 3.5 122B A10B2.45
3Qwen 3.5 35B A3B3.24
4Qwen 3.5 Plus3.53
5Gemini 3.1 Pro (Preview)3.82
6Qwen 3.5 397B A17B4.71
7DeepSeek V4 Pro7.06
8DeepSeek V4 Flash12.75
9Claude Sonnet 4.620.98
10Llama 3.1 70B Instruct64.41
11Llama 3.1 8B Instruct72.16

Interactive version: theaggregate.ai/benchmark?slug=rpcbench-error-group-unverifiable-premise-fact-fabrication · How It Works · Data refreshed daily, snapshot 2026-09-24.