Qwen3 Coder — benchmark results
Provider: Alibaba. Released 2025-07-23. Access: Open.
Unified ELO 1240 ± 48, rank #1640 of 1776 rated models, from 34 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| YapBench | 326.3 | YapIndex (lower is better) | 62.1 |
| Pencil Puzzle Bench - Heyawake | 0 | Direct-ask Success Rate (%) | 50 |
| Pencil Puzzle Bench - Sashigane | 0 | Direct-ask Success Rate (%) | 50 |
| Pencil Puzzle Bench - Shakashaka | 0 | Direct-ask Success Rate (%) | 50 |
| Pencil Puzzle Bench - Country | 0 | Direct-ask Success Rate (%) | 49 |
| Pencil Puzzle Bench - Double Choco | 0 | Direct-ask Success Rate (%) | 49 |
| Pencil Puzzle Bench - Kurodoko | 0 | Direct-ask Success Rate (%) | 48 |
| Pencil Puzzle Bench - Firefly | 0 | Direct-ask Success Rate (%) | 46 |
| Pencil Puzzle Bench - Sudoku | 0 | Direct-ask Success Rate (%) | 46 |
| WeirdML | 41.17 | Average Score | 43.1 |
| Pencil Puzzle Bench - Yajilin | 0 | Direct-ask Success Rate (%) | 43 |
| Bullshit Benchmark | 20 | BS Detection Rate (%) | 42.2 |
Interactive version: theaggregate.ai/model?slug=qwen3-coder · How the rankings work · Data refreshed daily, snapshot 2026-07-22.