VoiceLongMemEval - Indirect 140Q - Descriptive with Hint: leaderboard

Metric: Accuracy (%). Source: arxiv.org. Saturation forecast: Around July 2028. 8 models tracked.

Top models

#ModelScore
1Claude Opus 4.863.1
2Claude Sonnet 4.659.1
3Qwen 3.5 122B A10B57.1
4GPT-5.556.2
5Qwen3-Next-80B51.4
6Gemma 3 12B44.5
7Llama 3.3 70B42.4
8Llama 4 Maverick28.6

Interactive version: theaggregate.ai/benchmark?slug=voicelongmemeval-indirect-140q-descriptive-with-hint · How It Works · Data refreshed daily, snapshot 2026-09-24.