Coding Agent Leaderboard - RH SWE-Bench: leaderboard
Metric: Score (%). Source: huggingface.co. 11 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Opus 4.6 + Claude Code | 63.3 |
| 2 | Sonnet 4.6 + Claude Code | 55.7 |
| 3 | Qwen3.6-27B-FP8 + Claude Code | 49.3 |
| 4 | Qwen3.6-27B-FP8 + Pi | 46.8 |
| 5 | Qwen3.6-27B-FP8 + OpenCode | 44 |
| 6 | gpt-oss-120b + Claude Code | 31.7 |
| 7 | NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 + OpenCode | 30.8 |
| 8 | gpt-oss-120b + OpenCode | 29.4 |
| 9 | gpt-oss-120b + Pi | 23 |
| 10 | NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 + Claude Code | 22.4 |
Interactive version: theaggregate.ai/benchmark?slug=coding-agent-leaderboard-rh-swe-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.