RAI-Bench - RAG Robustness (LC Factuality): leaderboard

Metric: Rate (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Sonnet 456
2GPT-5.253
3Grok 452
4O351
5Claude Sonnet 4.550
6DeepSeek V4 Pro50
7Claude Opus 549
8GPT-5 Mini48
9Grok 4.1 Fast47
10GPT-546
11Grok 4.1 Fast (Reasoning)46
12Grok 4.346
13Claude Haiku 4.545
14O4 Mini45
15Claude Opus 4.744

Interactive version: theaggregate.ai/benchmark?slug=rai-bench-rag-robustness-lc-factuality · How It Works · Data refreshed daily, snapshot 2026-09-05.