CodeEditorBench Plus - Code Debug (Zero-shot): leaderboard

Metric: pass@1 (%, greedy decoding, zero-shot, CodeEditorBench_Plus). Source: codeeditorbench.github.io. Saturation forecast: Estimated already saturated. 19 models tracked.

Top models

#ModelScore
1GPT-4 (0613)31.6
2GPT-3.5 Turbo (1106)29
3Gemini 1.0 Pro28.6
4Phind-CodeLlama-34B-v223
5GLM-422
6CodeLlama-13B-Instruct-hf17.6
7Magicoder-S-CL-7B17.4
8CodeLlama-34B-hf16.3
9WizardCoder-15B-V1.015.9
10CodeLlama-7B-Instruct-hf15.5
11CodeLlama-34B-Instruct-hf13.1

Interactive version: theaggregate.ai/benchmark?slug=codeeditorbench-plus-code-debug-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-26.