Qwen3 Coder: benchmark results

Provider: Alibaba. Released 2025-07-23. Access: Open.

Unified ELO 1609 ± 1, rank #236 of 1392 rated models, from 37 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Pencil Puzzle Bench - Heyawake0Direct-ask Success Rate (%)50
Pencil Puzzle Bench - Sashigane0Direct-ask Success Rate (%)50
Pencil Puzzle Bench - Shakashaka0Direct-ask Success Rate (%)50
Pencil Puzzle Bench - Country0Direct-ask Success Rate (%)49
Pencil Puzzle Bench - Double Choco0Direct-ask Success Rate (%)49
Pencil Puzzle Bench - Kurodoko0Direct-ask Success Rate (%)48
Pencil Puzzle Bench - Firefly0Direct-ask Success Rate (%)46
Pencil Puzzle Bench - Sudoku0Direct-ask Success Rate (%)46
Pencil Puzzle Bench - Yajilin0Direct-ask Success Rate (%)43
EvasionBench78.16Macro-F1 (%)42.3
Pencil Puzzle Bench - Nurimaze0Direct-ask Success Rate (%)41
Do Coding Agents Understand Least-Privilege Au63.3TSR (self-reported)40

Interactive version: theaggregate.ai/model?slug=qwen3-coder · How It Works · Data refreshed daily, snapshot 2026-09-05.