FullStackBench en: leaderboard
English subset of FullStackBench for evaluating end-to-end software engineering and full-stack development capability.
Metric: Score (self-reported). Source: benchmarklist.com. Status: saturated. 31 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | O1 Preview | 65.62 |
| 2 | O1 Mini | 64.73 |
| 3 | Qwen 3.5 122B A10B | 62.6 |
| 4 | Claude 3.5 Sonnet | 62.57 |
| 5 | GPT-4o (2024-08-06) | 61.77 |
| 6 | Qwen 3.5 27B | 60.1 |
| 7 | DeepSeek V2.5 | 58.65 |
| 8 | Qwen 3.5 35B A3B | 58.1 |
| 9 | Qwen 2.5 72B Instruct | 56.88 |
| 10 | Qwen 2.5 Coder 32B Instruct | 56.88 |
| 11 | Qwen 2.5 Coder 14B Instruct | 55.28 |
| 12 | Qwen Max | 55.16 |
| 13 | Llama 3.1 70B Instruct | 51.45 |
| 14 | Qwen 2.5 Coder 7B Instruct | 47.95 |
| 15 | Yi-Coder-9B-Chat | 47.13 |
Interactive version: theaggregate.ai/benchmark?slug=fullstackbench-en · How It Works · Data refreshed daily, snapshot 2026-09-05.