FinMTM - Memory: leaderboard

Metric: FinMTM open-ended memory (L4: cross-page entity linking, long context and multi-source fusion) score (0-100) over 984 multi-turn financial sessions (about 4.25 turns each): half the mean LLM-judge rating of each turn on visual precision, financial logic, data accuracy, cross-modal verification and temporal awareness, half a session-level checklist for the task type; higher is better. Source: arxiv.org. Saturation forecast: Around May 2028. 22 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 3 Pro48.5#77
2GPT-546.7#91
3O343.6#121
4Qwen 3 VL 235B A22B (Thinking)43#228 (Qwen 3 VL 235B A22B)
5GLM-4.5V42.2#339
6Gemini 3 Flash41.6#93
7Qwen 3 VL 235B A22B Instruct41.5#264
8Qwen 3 VL 32B Instruct40.3#276
9GPT-4o38.9#333
10Qwen 3 VL 30B A3B (Thinking)35.1#338 (Qwen 3 VL 30B A3B)
11Qwen 2.5 VL 7B Instruct33.9#643
12Qwen 3 VL 30B A3B Instruct33.7#365
13Qwen 3 VL 32B (Thinking)33.7#287 (Qwen 3 VL 32B)
14InternVL3-78B32.6#345
15Qwen 3 VL 4B (Thinking)31#471 (Qwen 3 VL 4B)

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=finmtm-memory · How It Works · Data refreshed daily, snapshot 2026-10-11.