LongMemEval-V2: leaderboard
Long-term web-agent memory benchmark evaluating whether memory systems retrieve useful multimodal trajectory evidence for downstream question answering.
Source: github.com.
Interactive version: theaggregate.ai/benchmark?slug=longmemeval-v2 · How It Works · Data refreshed daily, snapshot 2026-09-05.