PersonaMem v1 - 128K - Generalize Reasons to New Scenarios: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 15 models tracked.

Top models

#ModelScore
1Gemini 1.5 Flash54
2GPT-4.153
3Gemini 2.0 Flash46
4GPT-4.546
5O139
6DeepSeek R138
7O4 Mini38
8GPT-4o Mini33
9Gemini 2.0 Flash Lite33
10GPT-4o32
11Llama 4 Maverick32
12O3 Mini30
13Claude 3.7 Sonnet29
14Claude 3.5 Haiku20

Interactive version: theaggregate.ai/benchmark?slug=personamem-v1-128k-generalize-reasons-to-new-scenarios · How It Works · Data refreshed daily, snapshot 2026-09-19.