Context-Bench Skills — leaderboard

Letta agentic context engineering benchmark: skills suite testing task completion and skill use capabilities across multi-step agentic workflows.

Metric: Task Completion (%). Source: leaderboard.letta.com. Status: saturation imminent. 22 models tracked.

Top models

#ModelScore
1GPT-5.2 (xHigh)85.31
2GPT-5.2 (High)84.47
3Claude Opus 4.681.32
4Claude Sonnet 4.679.08
5GPT-5.2 (Medium)77.55
6Claude Sonnet 4.576.5
7Claude Opus 4.5 (20251101)75.54
8DeepSeek V3 Chat75.33
9Claude Opus 4.1 (20250805)74.4
10Gemini 3 Pro72.73
11DeepSeek Reasoner70.48
12GPT-570.2
13Claude Haiku 4.5 (20251001)69.7
14GPT-5 Mini68.8
15GLM-4.665.9

Interactive version: theaggregate.ai/benchmark?slug=context-bench-skills · How the rankings work · Data refreshed daily, snapshot 2026-07-22.