ERP-Bench: leaderboard

Metric: Pass@5 (%). Source: benchmarklist.com. 12 models tracked.

Top models

#ModelScore
1GPT-5.5 (Coding)73
2GLM-5.1 (Coding)63.3
3Claude Opus 4.7 (Coding)60.7
4Claude Opus 4.7 (Browser)44.3
5Claude Opus 4.7 (Computer-use)38.3
6GPT-5.5 (Browser)23.7
7Kimi K2.5 (Coding)20.3
8GPT-5.5 (Computer-use)16.7
9GLM-5.1 (Browser)12
10Kimi K2.5 (Browser)7.3

Interactive version: theaggregate.ai/benchmark?slug=erp-bench · How It Works · Data refreshed daily, snapshot 2026-09-19.