RAI-Bench - RAG Robustness (HY Factuality): leaderboard

Metric: Rate (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Haiku 4.549
2Grok 449
3O349
4Grok 4.348
5Claude Opus 548
6O4 Mini47
7Claude Opus 4.745
8Gemini 2.5 Flash Lite45
9Grok 4.1 Fast (Reasoning)44
10DeepSeek V4 Pro43
11Claude Sonnet 543
12GLM-542
13Kimi K342
14GPT-5.6 Luna42
15Claude Sonnet 4.541

Interactive version: theaggregate.ai/benchmark?slug=rai-bench-rag-robustness-hy-factuality · How It Works · Data refreshed daily, snapshot 2026-09-05.