OpenClaw Arena Model Leaderboard — leaderboard

Personal AI agent benchmark evaluating frontier models across real-world OpenClaw-style tasks.

Metric: Avg Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 13 models tracked.

Top models

#ModelScore
1Claude Opus 4.567.4
2GPT-5.264.4
3Gemini 2.5 Pro63.8
4GPT-5.162.5
5Claude Sonnet 4.662.4
6Claude Opus 4.661.7
7Gemini 3.1 Pro (Preview)61
8GPT-5 Mini60.8
9GPT-4.160.5
10Claude Sonnet 457.8
11Claude Sonnet 4.557.5
12GPT-4o52.2
13GPT-4o Mini42.1

Interactive version: theaggregate.ai/benchmark?slug=openclaw-arena-model-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.