BlueBench - RAG General: leaderboard

Metric: Score (%). Source: huggingface.co. 18 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini54.58
2Mistral Medium 352.57
3Granite 3.3 8B Instruct51.92
4Mistral Large51.08
5GPT-4.1 Nano50.88
6Llama 3.3 70B Instruct49.02
7GPT-4o48.9
8GPT-4.148.46
9Pixtral-12B47.85
10Llama 3.2 3B Instruct47.81
11Llama 3.2 1B Instruct44.7
12O3 Mini44.06
13O141.24
14O4 Mini40.32

Interactive version: theaggregate.ai/benchmark?slug=bluebench-rag-general · How It Works · Data refreshed daily, snapshot 2026-09-05.