Coding Agent Leaderboard - SWE-Bench Pro -- Ansible — leaderboard

Metric: Score (%). Source: huggingface.co. 9 models tracked.

Top models

#ModelScore
1Opus 4.8 + OpenCode78.1
2Opus 4.8 + Claude Code69.8
3GPT 5.5 - high + Codex60.4
4Sonnet 4.6 + Claude Code50
5Qwen3.6-35B-A3B-NVFP4 + Pi47.9
6Qwen3.6-35B-A3B-NVFP4 + Claude Code45.8
7Qwen3.6-35B-A3B-NVFP4 + Qwen Code43.8
8Qwen3.6-35B-A3B-NVFP4 + OpenClaw40.6
9Qwen3.6-35B-A3B-NVFP4 + OpenCode37.5

Interactive version: theaggregate.ai/benchmark?slug=coding-agent-leaderboard-swe-bench-pro-ansible · How the rankings work · Data refreshed daily, snapshot 2026-07-22.