GitTaskBench (SWE-Agent): leaderboard

Metric: Task pass rate (%). Source: gittaskbench.github.io. Saturation forecast: Estimated already saturated. 9 models tracked.

Top models

#ModelScore
1Claude 3.7 Sonnet (20250219)42.59
2GPT-4.131.48
3Claude 3.5 Sonnet (20241022)22.23
4O3 Mini (Medium)20.37
5Llama 3.3 70B Instruct18.52
6DeepSeek V3 (0324)12.04
7Qwen 3 32B (Thinking)11.11
8GPT-4o (2024-08-06)10.19
9Qwen 3 32B (Non-reasoning)3.7

Interactive version: theaggregate.ai/benchmark?slug=gittaskbench-swe-agent · How It Works · Data refreshed daily, snapshot 2026-09-26.