Coding Agent Leaderboard - RH SWE-Bench: leaderboard

Metric: Score (%). Source: huggingface.co. 11 models tracked.

Top models

#ModelScore
1Opus 4.6 + Claude Code63.3
2Sonnet 4.6 + Claude Code55.7
3Qwen3.6-27B-FP8 + Claude Code49.3
4Qwen3.6-27B-FP8 + Pi46.8
5Qwen3.6-27B-FP8 + OpenCode44
6gpt-oss-120b + Claude Code31.7
7NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 + OpenCode30.8
8gpt-oss-120b + OpenCode29.4
9gpt-oss-120b + Pi23
10NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 + Claude Code22.4

Interactive version: theaggregate.ai/benchmark?slug=coding-agent-leaderboard-rh-swe-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.