RedCode - Gen (Base LLM): leaderboard
Metric: Harmful-code generation accuracy (%). Source: arxiv.org. 9 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | RedCode Gen GPT-3.5 (checkpoint unspecified) | 0 |
| 2 | RedCode Gen Claude-Opus (checkpoint unspecified) | 1.3 |
| 3 | RedCode Gen Llama-2-7B (checkpoint unspecified) | 16.9 |
| 4 | RedCode Gen CodeLlama-7B (checkpoint unspecified) | 40 |
| 5 | RedCode Gen Mistral-7B (checkpoint unspecified) | 46.3 |
| 6 | RedCode Gen DeepSeekCoder (checkpoint unspecified) | 49.4 |
| 7 | RedCode Gen CodeLlama-13B (checkpoint unspecified) | 49.4 |
| 8 | RedCode Gen GPT-4 (checkpoint unspecified) | 65 |
| 9 | RedCode Gen GPT-4o (checkpoint unspecified) | 69.4 |
Interactive version: theaggregate.ai/benchmark?slug=redcode-gen-base-llm · How It Works · Data refreshed daily, snapshot 2026-10-09.