LUNAR - RAG: leaderboard

Metric: Personalization score (1-5; mean of coverage and depth, GPT-5.1 judge). Source: arxiv.org. 19 models tracked.

Top models

#ModelScore
1Kimi K2.63.15
2GLM-5.13.13
3Gemini 3 Flash (Preview)3.13
4DeepSeek V4 Flash3
5MiniMax-M2.72.93
6GPT-4.1 Mini2.86
7Ling-2.6-1T2.79
8DeepSeek V4 Pro2.74
9Qwen 3 30B A3B 2507 Instruct2.71
10Qwen 3 14B (Non-reasoning)2.68
11Ling-2.6-flash2.62
12GLM-4.7 Flash2.6
13GPT-4o Mini2.58
14Qwen 3 8B (Non-reasoning)2.58
15Qwen 3 32B (Non-reasoning)2.4

Interactive version: theaggregate.ai/benchmark?slug=lunar-rag · How It Works · Data refreshed daily, snapshot 2026-09-19.