GitTaskBench (OpenHands): leaderboard

Metric: Task pass rate (%). Source: gittaskbench.github.io. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1Claude 3.7 Sonnet (20250219)48.15
2GPT-4.142.59
3Claude 3.5 Sonnet (20241022)40.74
4Gemini 2.5 Pro35.19
5Qwen 3 32B (Thinking)29.63
6DeepSeek V3 (0324)26.85
7Qwen 3 32B (Non-reasoning)25.93
8O3 Mini (Medium)22.22
9Llama 3.3 70B Instruct20.37
10GPT-4o (2024-08-06)14.82
11Qwen 3 14B (Non-reasoning)5.56
12Qwen 3 8B (Non-reasoning)1.85

Interactive version: theaggregate.ai/benchmark?slug=gittaskbench-openhands · How It Works · Data refreshed daily, snapshot 2026-09-26.