WorldMemArena: leaderboard

Metric: QA Correct (%; share of answers a GPT-5.4-mini judge marks correct against the gold answer and evidence, over long multi-session memory trajectories). Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1GPT-5.4 Mini58.27
2Gemini 3 Flash51.69
3Qwen 3.5 Plus51.05
4Claude Haiku 4.536.71

Interactive version: theaggregate.ai/benchmark?slug=worldmemarena · How It Works · Data refreshed daily, snapshot 2026-09-26.