Coding Agent Leaderboard - SWE-Bench Verified: leaderboard

Metric: Score (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Opus 4.8 + Claude Code86.8
2Opus 4.8 + OpenCode83.4
3GPT 5.5 - high + Codex79.8
4Sonnet 4.6 + Claude Code79.6
5Qwen3.6-27B-FP8 + Claude Code69.4
6Qwen3.6-27B-FP8 + Pi69.4
7Qwen3.6-35B-A3B-NVFP4 + Pi65
8Qwen3.6-27B-FP8 + OpenCode64.2
9Qwen3.6-35B-A3B-NVFP4 + Qwen Code63.8
10Qwen3.6-35B-A3B-NVFP4 + Claude Code63.2

Interactive version: theaggregate.ai/benchmark?slug=coding-agent-leaderboard-swe-bench-verified · How It Works · Data refreshed daily, snapshot 2026-09-05.