Coding Agent Leaderboard - SWE-Bench Pro -- Ansible: leaderboard

Metric: Score (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Opus 4.8 + OpenCode78.1
2Opus 4.8 + Claude Code69.8
3GPT 5.5 - high + Codex60.4
4Qwen3.6-27B-FP8 + OpenCode57.3
5Qwen3.6-27B-FP8 + Claude Code52.1
6Sonnet 4.6 + Claude Code50
7Qwen3.6-27B-FP8 + Pi49
8Qwen3.6-35B-A3B-NVFP4 + Pi47.9
9gemma-4-31B-it-FP8-block + Pi46.9
10Qwen3.6-35B-A3B-NVFP4 + Claude Code45.8

Interactive version: theaggregate.ai/benchmark?slug=coding-agent-leaderboard-swe-bench-pro-ansible · How It Works · Data refreshed daily, snapshot 2026-09-05.