Horizon — leaderboard

Orin Labs long-horizon agent-learning benchmark with 195 tasks drawn from months of real customer interactions and scored by task pass rate.

Metric: Task Pass Rate (%). Source: www.orinlabs.ai. 24 models tracked.

Top models

#ModelScore
1OpenClaw (LCM) - claude-opus-4.857.95
2OpenClaw (LCM) - gemini-3.5-flash57.44
3OpenClaw (LCM) - gpt-5.556.92
4RLM - claude-opus-4.855.9
5OpenClaw (LCM) - gemini-3.1-pro-preview52.58
6RLM - gpt-550.77
7RLM - claude-sonnet-4.649.74
8Codex - gpt-5-codex46.15
9Claude Code - claude-opus-4.845.13
10OpenClaw (LCM) - claude-sonnet-4.542.05

Interactive version: theaggregate.ai/benchmark?slug=horizon · How the rankings work · Data refreshed daily, snapshot 2026-07-22.