ImplicitMemBench - Procedural Memory: leaderboard

Metric: First-attempt accuracy (%) on the 100 procedural-memory items: a one-shot procedure learned in conversation must be applied after interference, checked by rules or GPT-4o-mini (learning, interference and test phases, first-attempt scoring, mean of three runs at temperature 0); higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 17 models tracked.

Top models

#ModelScore
1Claude Opus 4.176.67
2DeepSeek R176.33
3GLM-4.576.33
4O376
5Qwen 3 32B75.67
6GPT-575.33
7Qwen 3 8B75.33
8Gemini 2.5 Pro74.33
9Gemini 2.5 Flash72.33
10O4 Mini (High)70.67
11GPT-4o61.67
12GPT-4o Mini61.67
13Qwen 2.5 72B Instruct61
14Llama 3.3 70B Instruct58.33
15Claude Sonnet 451.67

Interactive version: theaggregate.ai/benchmark?slug=implicitmembench-procedural-memory · How It Works · Data refreshed daily, snapshot 2026-10-07.