ClaimRAG-LAW — leaderboard
Legal RAG benchmark for claim extraction and verification over English GDPR and French civil-law settings, reporting retrieval, generation, hallucination, and overall F1 metrics.
Metric: Overall F1 (%). Source: arxiv.org. 17 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | BM25 + GPT-4 (FR) | 70.3 |
| 2 | BM25 + GPT-5 (FR) | 69.9 |
| 3 | E5 + GPT-5 (FR) | 65 |
| 4 | E5 + GPT-4 (FR) | 64.9 |
| 5 | E5 + Mixtral-8x7B (FR) | 61.4 |
| 6 | BM25 + GPT-4 (EN) | 60.9 |
| 7 | E5 + GPT-5 (EN) | 60.7 |
| 8 | E5 + GPT-4 (EN) | 58.3 |
| 9 | BM25 + GPT-5 (EN) | 56.8 |
| 10 | E5 + Llama3-8B (FR) | 52.8 |
Interactive version: theaggregate.ai/benchmark?slug=claimrag-law · How the rankings work · Data refreshed daily, snapshot 2026-07-22.