EnterpriseRAG Bench - Correctness — leaderboard

Metric: Score (%). Source: huggingface.co. 16 models tracked.

Top models

#ModelScore
1Troml83.8
2OpenClaw81.6
3OpenAI File Search69.8
4BM25 + GPT-5.468.8
5Bash Agent (GPT-5.4) + GPT-5.460.6
6NVIDIA AI Blueprints59.6
7Azure AI Search56.4
8RAGFlow56
9Amazon Q (Kendra)55.4
10Vector (text-embedding-3-large) + GPT-5.451.4

Interactive version: theaggregate.ai/benchmark?slug=enterpriserag-bench-correctness · How the rankings work · Data refreshed daily, snapshot 2026-07-22.