CodeQwen1.5-7B Chat: benchmark results

Chat-tuned CodeQwen1.5 7B checkpoint, kept separate from the base CodeQwen1.5 7B row. Provider: Alibaba. Released 2024-04-16. Access: Open.

Unified ELO 1435 ± 19, rank #1855 of 2928 rated models, from 20 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BigCode Models Leaderboard87.2HumanEval Python Pass@1 (%)99.2
RedCode74.75Score (%)92.9
Big Code Memorization - HumanEval-ET pass@160.98HumanEval-ET pass@1 (%)88.2
EvalPlus (HumanEval+ & MBPP+)73.8Pass@1 avg (%)87.9
Big Code Memorization - HumanEval pass@169.51HumanEval pass@1 (%)82.4
Big Code Memorization - HumanEval pass@5063.68HumanEval pass@50 (%)82.4
Big Code Memorization - HumanEval-ET pass@5055.66HumanEval-ET pass@50 (%)82.4
BigCodeBench39.6Pass@1 (%)56.4
RepoQA62.8Score (self-reported)56.2
EvalPlus73.85EvalPlus Avg. (self-reported)45.8
Open LLM Leaderboard v1 - GSM8K27.9Accuracy (%) (5-shot)45.6
HumanEval+78.7HumanEval+ pass@1 (self-reported)43.5

Interactive version: theaggregate.ai/model?slug=codeqwen1-5-7b-chat · How It Works · Data refreshed daily, snapshot 2026-09-23.