RuVerBench - Agentic Coding: leaderboard

Metric: Balanced Accuracy (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)89.4
2Gemini 3.1 Pro (Preview) (High)86.5
3Claude Opus 4.7 (Max)85
4Kimi K2.6 (Thinking)84.3
5DeepSeek V4 Pro (Max)83.8
6Claude Sonnet 4.6 (Max)83
7DeepSeek V4 Flash (Max)81.3
8GLM-5.1 (Thinking)80.8
9Qwen 3.6 Max (Preview) (Thinking)79.9
10MiMo V2.5 Pro (Thinking)78.5
11GPT-OSS-120B (High)77.1
12Qwen 3.5 122B A10B (Thinking)75
13Qwen 3.5 27B (Thinking)74
14GPT-OSS-20B (High)72.3
15Qwen 3.5 9B (Thinking)71.6

Interactive version: theaggregate.ai/benchmark?slug=ruverbench-agentic-coding · How It Works · Data refreshed daily, snapshot 2026-09-19.