LUNAR - Agentic Memory: leaderboard

Metric: Personalization score (1-5; mean of coverage and depth, GPT-5.1 judge). Source: arxiv.org. 19 models tracked.

Top models

#ModelScore
1Kimi K2.62.97
2GLM-5.12.9
3Gemini 3 Flash (Preview)2.9
4DeepSeek V4 Flash2.81
5MiniMax-M2.72.75
6GPT-4.1 Mini2.69
7DeepSeek V4 Pro2.66
8Qwen 3 30B A3B 2507 Instruct2.56
9Ling-2.6-1T2.54
10GPT-4o Mini2.48
11GLM-4.7 Flash2.4
12Ling-2.6-flash2.4
13Qwen 3 14B (Non-reasoning)2.36
14Qwen 3 8B (Non-reasoning)2.24
15Qwen 3 32B (Non-reasoning)2.2

Interactive version: theaggregate.ai/benchmark?slug=lunar-agentic-memory · How It Works · Data refreshed daily, snapshot 2026-09-19.