FullStackBench en: leaderboard

English subset of FullStackBench for evaluating end-to-end software engineering and full-stack development capability.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturated. 31 models tracked.

Top models

#ModelScore
1O1 Preview65.62
2O1 Mini64.73
3Qwen 3.5 122B A10B62.6
4Claude 3.5 Sonnet62.57
5GPT-4o (2024-08-06)61.77
6Qwen 3.5 27B60.1
7DeepSeek V2.558.65
8Qwen 3.5 35B A3B58.1
9Qwen 2.5 72B Instruct56.88
10Qwen 2.5 Coder 32B Instruct56.88
11Qwen 2.5 Coder 14B Instruct55.28
12Qwen Max55.16
13Llama 3.1 70B Instruct51.45
14Qwen 2.5 Coder 7B Instruct47.95
15Yi-Coder-9B-Chat47.13

Interactive version: theaggregate.ai/benchmark?slug=fullstackbench-en · How It Works · Data refreshed daily, snapshot 2026-09-05.