RAI-Bench - RAG Robustness (LC Abstention): leaderboard

Metric: Rate (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Sonnet 497
2Claude Haiku 4.597
3Claude Sonnet 4.596
4DeepSeek V4 Pro95
5Grok 4.1 Fast95
6DeepSeek V4 Flash93
7Grok 4.393
8GPT-5.4 Nano92
9GPT-5.290
10DeepSeek V3.289
11Grok 4.1 Fast (Reasoning)89
12Claude Opus 4.589
13Claude Opus 589
14GPT-5 Chat89
15Gemini 3.5 Flash88

Interactive version: theaggregate.ai/benchmark?slug=rai-bench-rag-robustness-lc-abstention · How It Works · Data refreshed daily, snapshot 2026-09-05.