StratMem-Bench: leaderboard

Metric: Strategic memory coverage SMC (%): share of virtual-character responses that use every must-use memory and appropriate nice-to-use memories, over all instances weighted by scenario counts; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 9 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.551.45
2Gemini 3 Pro (Preview)50.68
3Llama 4 Maverick50.23
4GPT-5.248.55
5Qwen 3 235B A22B 2507 Instruct47.18
6Qwen 3 Max46.42
7GPT-5 Chat46.27
8DeepSeek V3.245.66

Interactive version: theaggregate.ai/benchmark?slug=stratmem-bench · How It Works · Data refreshed daily, snapshot 2026-10-07.