GitTaskBench (OpenHands) - Execution Completion: leaderboard

Metric: Execution completion rate (%). Source: gittaskbench.github.io. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1Claude 3.7 Sonnet (20250219)72.22
2GPT-4.155.56
3Claude 3.5 Sonnet (20241022)53.7
4Gemini 2.5 Pro51.85
5DeepSeek V3 (0324)45.37
6Qwen 3 32B (Thinking)44.44
7Qwen 3 32B (Non-reasoning)35.19
8O3 Mini (Medium)29.63
9Llama 3.3 70B Instruct27.78
10GPT-4o (2024-08-06)21.3
11Qwen 3 14B (Non-reasoning)11.11
12Qwen 3 8B (Non-reasoning)1.85

Interactive version: theaggregate.ai/benchmark?slug=gittaskbench-openhands-execution-completion · How It Works · Data refreshed daily, snapshot 2026-09-26.