RideWay: leaderboard

Metric: Efficiency Utility (success-gated, held-out custom14 mean over 14 tasks x 3 attempts; a successful trajectory is discounted for excess tool calls and user-facing turns beyond human reference floors, penalties fit from human pairwise preferences; failures score 0). Source: arxiv.org. Saturation forecast: Around September 2027. 24 models tracked.

Top models

#ModelScore
1GPT-5.5 (Non-reasoning)70.5
2Qwen 3.7 Max (Non-reasoning)66.1
3Qwen 3.6 27B (Non-reasoning)63.8
4Claude Sonnet 563.7
5Gemma 4 31B62.8
6GLM-5.2 (Non-reasoning)62
7Qwen 3.6 Plus (Non-reasoning)61.2
8Claude Opus 4.660.6
9MiMo-V2.5-Pro (Non-reasoning)59
10Kimi K2.6 (Non-reasoning)56.3
11DeepSeek V4 Pro (Non-reasoning)54.3
12Gemma 4 26B49.3
13Gemini 3.5 Flash (Minimal)44.3
14Qwen 3.5 9B (Non-reasoning)43.1
15Qwen 3.6 35B A3B (Non-reasoning)32.3

Interactive version: theaggregate.ai/benchmark?slug=rideway · How It Works · Data refreshed daily, snapshot 2026-09-26.