RedCode - Gen (Base LLM): leaderboard

Metric: Harmful-code generation accuracy (%). Source: arxiv.org. 9 models tracked.

Top models

#ModelScore
1RedCode Gen GPT-3.5 (checkpoint unspecified)0
2RedCode Gen Claude-Opus (checkpoint unspecified)1.3
3RedCode Gen Llama-2-7B (checkpoint unspecified)16.9
4RedCode Gen CodeLlama-7B (checkpoint unspecified)40
5RedCode Gen Mistral-7B (checkpoint unspecified)46.3
6RedCode Gen DeepSeekCoder (checkpoint unspecified)49.4
7RedCode Gen CodeLlama-13B (checkpoint unspecified)49.4
8RedCode Gen GPT-4 (checkpoint unspecified)65
9RedCode Gen GPT-4o (checkpoint unspecified)69.4

Interactive version: theaggregate.ai/benchmark?slug=redcode-gen-base-llm · How It Works · Data refreshed daily, snapshot 2026-10-09.