RedCode - Gen (Code Agent): leaderboard
Metric: Harmful-code generation accuracy (%). Source: arxiv.org. 9 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | RedCode Gen Claude-Opus (checkpoint unspecified) | 3.1 |
| 2 | RedCode Gen Llama-2-7B (checkpoint unspecified) | 20.7 |
| 3 | RedCode Gen GPT-3.5 (checkpoint unspecified) | 32.5 |
| 4 | RedCode Gen CodeLlama-7B (checkpoint unspecified) | 42 |
| 5 | RedCode Gen CodeLlama-13B (checkpoint unspecified) | 66.3 |
| 6 | RedCode Gen GPT-4 (checkpoint unspecified) | 66.9 |
| 7 | RedCode Gen GPT-4o (checkpoint unspecified) | 72.5 |
| 8 | RedCode Gen Mistral-7B (checkpoint unspecified) | 75.3 |
| 9 | RedCode Gen DeepSeekCoder (checkpoint unspecified) | 79.4 |
Interactive version: theaggregate.ai/benchmark?slug=redcode-gen-code-agent · How It Works · Data refreshed daily, snapshot 2026-10-09.