MemLens (32K): leaderboard

Metric: Overall accuracy (%) on all 789 questions (information extraction, multi-session, temporal and knowledge-update reasoning and answer refusal) at a 32K-token history, interleaved multimodal multi-session conversation history with the evidence sessions hidden among haystack sessions, judged correct or incorrect by a Qwen3-VL-235B-A22B-Instruct judge; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 27 models tracked.

Top models

#ModelScore
1Qwen 3.5 122B A10B58.68
2Qwen 3 VL 30B A3B Instruct55.01
3Kimi K2.554.88
4Qwen 3 VL 235B A22B Instruct53.23
5Qwen 3.5 27B52.98
6GPT-5.452.72
7GLM-4.6V52.34
8Qwen 3.5 9B50.32
9Qwen 3 VL 8B Instruct49.18
10Qwen 3 VL 235B A22B (Thinking)48.29
11Qwen 3 VL 8B (Thinking)46.01
12Nemotron Nano 12B v2 VL44.99
13Qwen 3.5 4B44.36
14Qwen 3.5 2B44.36
15Qwen 3 VL 4B Instruct44.23

Interactive version: theaggregate.ai/benchmark?slug=memlens-32k · How It Works · Data refreshed daily, snapshot 2026-10-07.