FullStackBench (2024-12 bilingual): leaderboard

Metric: Pass@1 (%), 3,374 problems: 1,687 English and 1,687 Chinese; December 2024 release. Source: github.com. Saturation forecast: Estimated already saturated. 27 models tracked.

Top models

#ModelScore
1O1 Preview65.62
2O1 Mini64.73
3Claude 3.5 Sonnet62.57
4GPT-4o (2024-08-06)61.77
5Qwen 2.5 72B Instruct56.88
6Qwen 2.5 Coder 32B Instruct56.88
7GLM-4 Plus56.4
8Qwen 2.5 Coder 14B Instruct55.28
9Qwen Max55.16
10Llama 3.1 70B Instruct51.45
11Qwen 2.5 Coder 7B Instruct47.95
12Yi-Coder-9B-Chat47.13
13OpenCoder-8B-Instruct43.63
14deepseek-coder-6.7B-instruct41.88
15CodeQwen1.5-7B Chat40.52

Interactive version: theaggregate.ai/benchmark?slug=fullstackbench-2024-12-bilingual · How It Works · Data refreshed daily, snapshot 2026-10-08.