Qwen3 Coder: benchmark results
Provider: Alibaba. Released 2025-07-23. Access: Open.
Unified ELO 1609 ± 1, rank #236 of 1392 rated models, from 37 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Pencil Puzzle Bench - Heyawake | 0 | Direct-ask Success Rate (%) | 50 |
| Pencil Puzzle Bench - Sashigane | 0 | Direct-ask Success Rate (%) | 50 |
| Pencil Puzzle Bench - Shakashaka | 0 | Direct-ask Success Rate (%) | 50 |
| Pencil Puzzle Bench - Country | 0 | Direct-ask Success Rate (%) | 49 |
| Pencil Puzzle Bench - Double Choco | 0 | Direct-ask Success Rate (%) | 49 |
| Pencil Puzzle Bench - Kurodoko | 0 | Direct-ask Success Rate (%) | 48 |
| Pencil Puzzle Bench - Firefly | 0 | Direct-ask Success Rate (%) | 46 |
| Pencil Puzzle Bench - Sudoku | 0 | Direct-ask Success Rate (%) | 46 |
| Pencil Puzzle Bench - Yajilin | 0 | Direct-ask Success Rate (%) | 43 |
| EvasionBench | 78.16 | Macro-F1 (%) | 42.3 |
| Pencil Puzzle Bench - Nurimaze | 0 | Direct-ask Success Rate (%) | 41 |
| Do Coding Agents Understand Least-Privilege Au | 63.3 | TSR (self-reported) | 40 |
Interactive version: theaggregate.ai/model?slug=qwen3-coder · How It Works · Data refreshed daily, snapshot 2026-09-05.