ORAgentBench — leaderboard

Metric: Pass Rate All (self-reported). Source: benchmarklist.com. 14 models tracked.

Top models

#ModelScore
1GPT-5.435.51
2Claude Opus 4.634.58
3GPT-5.3 Codex32.71
4DeepSeek V4 Pro27.1
5GLM-5.126.17
6GPT-5.4 Mini26.17
7DeepSeek V4 Flash26.17
8Claude Sonnet 4.625.23
9Qwen 3.6 Plus22.43
10GLM-522.43
11MiMo-V2.5-Pro22.43
12Qwen 3.5 Plus (2026-04-20)20.56
13MiniMax-M2.714.02

Interactive version: theaggregate.ai/benchmark?slug=oragentbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.