MemLens (64K) - Knowledge Update: leaderboard

Metric: Accuracy (%) on the knowledge update (KU, 116 questions) at a 64K-token history, interleaved multimodal multi-session conversation history with the evidence sessions hidden among haystack sessions, judged correct or incorrect by a Qwen3-VL-235B-A22B-Instruct judge; higher is better. Source: arxiv.org. Saturation forecast: Around July 2027. 27 models tracked.

Top models

#ModelScore
1Kimi K2.549.14
2Qwen 3.5 27B43.97
3GPT-5.443.1
4Qwen 3 VL 30B A3B Instruct39.66
5Qwen 3.5 9B37.93
6Qwen 3 VL 235B A22B Instruct36.21
7Qwen 3 VL 235B A22B (Thinking)35.34
8GLM-4.6V34.48
9Nemotron Nano 12B v2 VL34.48
10Qwen 3 VL 8B (Thinking)30.17
11Qwen 3 VL 8B Instruct29.31
12Qwen 3 VL 30B A3B (Thinking)29.31
13Qwen 3.5 4B28.45
14Gemma 3 27B (IT)27.59
15Phi-4 Multimodal Instruct24.14

Interactive version: theaggregate.ai/benchmark?slug=memlens-64k-knowledge-update · How It Works · Data refreshed daily, snapshot 2026-10-07.