EnterpriseMem-Bench: leaderboard

Metric: Execution accuracy (%; all 1,400 turns of 300 multi-turn Text-to-SQL sessions over BIRD Financial, SEC EDGAR and Northwind; Condition B: two-turn working memory plus resolved context keys; single run). Source: arxiv.org. Saturation forecast: Around April 2027. 8 models tracked.

Top models

#ModelScore
1GPT-5.286.4
2GPT-5 Mini83.2
3Claude Sonnet 4.5 (Non-reasoning)79.8
4Claude Sonnet 4.6 (Non-reasoning)59.6
5Claude Opus 4.6 (Non-reasoning)58.7

Interactive version: theaggregate.ai/benchmark?slug=enterprisemem-bench · How It Works · Data refreshed daily, snapshot 2026-09-26.