GitTaskBench (SWE-Agent) - Execution Completion: leaderboard

Metric: Execution completion rate (%). Source: gittaskbench.github.io. Saturation forecast: Estimated already saturated. 9 models tracked.

Top models

#ModelScore
1Claude 3.7 Sonnet (20250219)64.81
2Claude 3.5 Sonnet (20241022)41.67
3GPT-4.138.89
4O3 Mini (Medium)25.93
5Llama 3.3 70B Instruct25.83
6DeepSeek V3 (0324)18.52
7GPT-4o (2024-08-06)17.58
8Qwen 3 32B (Thinking)16.67
9Qwen 3 32B (Non-reasoning)7.41

Interactive version: theaggregate.ai/benchmark?slug=gittaskbench-swe-agent-execution-completion · How It Works · Data refreshed daily, snapshot 2026-09-26.