FullStackBench en — leaderboard

English subset of FullStackBench for evaluating end-to-end software engineering and full-stack development capability.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 28 models tracked.

Top models

#ModelScore
1O1 Preview65.62
2O1 Mini64.73
3Claude 3.5 Sonnet62.57
4GPT-4o61.77
5DeepSeek V2.558.65
6Qwen 2.5 72B Instruct56.88
7Qwen 2.5 Coder 32B Instruct56.88
8Qwen 2.5 Coder 14B Instruct55.28
9Llama 3.1 70B Instruct51.45
10Qwen 2.5 Coder 7B Instruct47.95
11Yi-Coder-9B-Chat47.13
12OpenCoder-8B-Instruct43.63
13deepseek-coder-6.7B-instruct41.88
14OpenCoder-1.5B-Instruct33.52
15CodeLlama-34B-Instruct29.22

Interactive version: theaggregate.ai/benchmark?slug=fullstackbench-en · How the rankings work · Data refreshed daily, snapshot 2026-07-22.