CCBench: leaderboard

About 180 feature tasks in private CodeCrafters codebases (e.g. add authentication to a Redis clone, backreferences to a regex engine), graded by CodeCrafters' test runners; success rate (2026).

Metric: Accuracy (%). Source: huggingface.co. Status: saturated. 229 models tracked.

Top models

#ModelScore
1InternVL3-78B83.5
2InternVL3-38B80.6
3InternVL3-8B77.8
4InternVL2-8B77.1
5GPT-4.1 (2025-04-14)73.5
6Qwen 2 VL 72B69.8
7Qwen 2 VL 7B65.7
8GPT-4.1 Mini64.3
9Grok 2 (1212)57.3
10Claude 3.5 Sonnet (20241022)56.1
11Claude 3.7 Sonnet55.1
12Claude 3.5 Sonnet54.1
13Llama 3.2 90B Vision Instruct54.1
14Qwen 2 VL 2B53.7
15Gemma 3 27B53.3

Interactive version: theaggregate.ai/benchmark?slug=ccbench · How It Works · Data refreshed daily, snapshot 2026-09-05.