ORAgentBench: leaderboard

Metric: Pass Rate All (self-reported). Source: benchmarklist.com. 14 models tracked.

Top models

#ModelScore
1GPT-5.435.51
2Claude Opus 4.634.58
3GPT-5.3 Codex32.71
4Kimi K2.627.1
5DeepSeek V4 Pro27.1
6GLM-5.126.17
7DeepSeek V4 Flash26.17
8GPT-5.4 Mini26.17
9Claude Sonnet 4.625.23
10Qwen 3.6 Plus22.43
11GLM-522.43
12MiMo-V2.5-Pro22.43
13Qwen 3.5 Plus20.56
14MiniMax-M2.714.02

Interactive version: theaggregate.ai/benchmark?slug=oragentbench · How It Works · Data refreshed daily, snapshot 2026-09-05.