LongMemEval-V2 — leaderboard
Long-term web-agent memory benchmark evaluating whether memory systems retrieve useful multimodal trajectory evidence for downstream question answering.
Source: github.com.
Interactive version: theaggregate.ai/benchmark?slug=longmemeval-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.