Coding Agent Leaderboard - SWE-Bench Verified — leaderboard

Metric: Score (%). Source: huggingface.co. 9 models tracked.

Top models

#ModelScore
1Opus 4.8 + Claude Code86.8
2Opus 4.8 + OpenCode83.4
3GPT 5.5 - high + Codex79.8
4Sonnet 4.6 + Claude Code79.6
5Qwen3.6-35B-A3B-NVFP4 + Pi65
6Qwen3.6-35B-A3B-NVFP4 + Qwen Code63.8
7Qwen3.6-35B-A3B-NVFP4 + Claude Code63.2
8Qwen3.6-35B-A3B-NVFP4 + OpenClaw58.8
9Qwen3.6-35B-A3B-NVFP4 + OpenCode54.8

Interactive version: theaggregate.ai/benchmark?slug=coding-agent-leaderboard-swe-bench-verified · How the rankings work · Data refreshed daily, snapshot 2026-07-22.