RideWay - Success Rate: leaderboard

Metric: Success rate (%; share of trials passing the three-judge LLM success gate over the pooled 58-task suite, 3 attempts per model). Source: arxiv.org. Saturation forecast: Around December 2026. 24 models tracked.

Top models

#ModelScore
1MiMo-V2.5-Pro (Non-reasoning)87.4
2Claude Sonnet 582.8
3Gemini 3.5 Flash (Minimal)82.2
4Claude Opus 4.681.6
5DeepSeek V4 Pro (Non-reasoning)81
6GLM-5.2 (Non-reasoning)78.7
7Qwen 3.6 27B (Non-reasoning)77
8Gemma 4 31B75.9
9GPT-5.5 (Non-reasoning)75.3
10Qwen 3.7 Max (Non-reasoning)74.1
11Qwen 3.6 Plus (Non-reasoning)71.8
12Kimi K2.6 (Non-reasoning)61.5
13Gemma 4 26B60.3
14Qwen 3.5 9B (Non-reasoning)59.2
15Qwen 3.6 35B A3B (Non-reasoning)56.3

Interactive version: theaggregate.ai/benchmark?slug=rideway-success-rate · How It Works · Data refreshed daily, snapshot 2026-09-26.