Horizon - Hard — leaderboard

Metric: Task Pass Rate (%). Source: www.orinlabs.ai. 24 models tracked.

Top models

#ModelScore
1RLM - claude-opus-4.821.54
2OpenClaw (LCM) - gemini-3.5-flash21.54
3OpenClaw (LCM) - gemini-3.1-pro-preview20.31
4OpenClaw (LCM) - claude-opus-4.816.92
5OpenClaw (LCM) - gpt-5.515.38
6Claude Code - claude-opus-4.815.38
7OpenClaw (LCM) - deepseek-v4-pro14.06
8RLM - claude-sonnet-4.613.85
9Codex - gpt-5-codex13.85
10Hermes - claude-sonnet-4.513.85

Interactive version: theaggregate.ai/benchmark?slug=horizon-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.