Context-Bench Filesystem — leaderboard

Letta agentic context engineering benchmark: filesystem suite testing file operations, relationship tracing, and multi-step information retrieval.

Metric: Rubric Score (%). Source: leaderboard.letta.com. Status: saturation imminent. 15 models tracked.

Top models

#ModelScore
1GPT-5.2 Codex (xHigh)93
2GPT-5.4 (xHigh)89
3Claude Sonnet 4.688
4GPT-5.2 (xHigh)87
5GPT-5.3 Codex (xHigh)85
6Claude Opus 4.684
7Gemini 3 Flash82
8GPT-5 Mini (High)67
9Claude Opus 4.5 (20251101)63
10Kimi K2.557
11Claude Sonnet 4.548
12Claude Haiku 4.543
13GLM-539
14MiniMax-M2.537

Interactive version: theaggregate.ai/benchmark?slug=context-bench-filesystem · How the rankings work · Data refreshed daily, snapshot 2026-07-22.