Workspace-Bench — leaderboard

Workspace-agent benchmark over file-heavy tasks involving documents, spreadsheets, presentations, code, and multi-file dependencies.

Metric: Overall Score (%). Source: workspace-bench.github.io. 45 models tracked.

Top models

#ModelScore
1OpenClaw (Opus-4.7, Test-Rubrics-Checked)66.7
2ClaudeCode (Opus-4.7, Test-Rubrics-Checked)64.7
3Hermes (Opus-4.7, Test-Rubrics-Checked)64.5
4DeepAgent (GLM-5.1, Test-Rubrics-Checked)61
5Hermes (GLM-5.1, Test-Rubrics-Checked)57.7
6OpenClaw (GLM-5.1, Test-Rubrics-Checked)57.5
7OpenClaw (Qwen-3.6-Plus, Test-Rubrics-Checked)55.6
8ClaudeCode (MiniMax-M2.7, Test-Rubrics-Checked)54.6
9DeepAgent (Opus-4.7, Test-Rubrics-Checked)54.4
10Codex (GLM-5.1, Test-Rubrics-Checked)53.1

Interactive version: theaggregate.ai/benchmark?slug=workspace-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.