RAMP: leaderboard

Metric: Mean Reward (0-100, weighted task score). Source: arxiv.org. Saturation forecast: Around June 2027. 15 models tracked.

Top models

#ModelScore
1Claude Opus 4.793.39
2DeepSeek V4 Pro85.34
3DeepSeek V4 Flash66.48
4GPT-5.565.91
5Qwen 3.6 Max Preview56.72
6Kimi K2.540.24
7Kimi K2.633.94
8GLM-4.630.88
9Qwen 3.5 Plus29.63
10GLM-4.729.5
11GLM-5.127.26
12MiniMax-M2.525.09

Interactive version: theaggregate.ai/benchmark?slug=ramp · How It Works · Data refreshed daily, snapshot 2026-09-25.