Qwen3 Coder — benchmark results

Provider: Alibaba. Released 2025-07-23. Access: Open.

Unified ELO 1240 ± 48, rank #1640 of 1776 rated models, from 34 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
YapBench326.3YapIndex (lower is better)62.1
Pencil Puzzle Bench - Heyawake0Direct-ask Success Rate (%)50
Pencil Puzzle Bench - Sashigane0Direct-ask Success Rate (%)50
Pencil Puzzle Bench - Shakashaka0Direct-ask Success Rate (%)50
Pencil Puzzle Bench - Country0Direct-ask Success Rate (%)49
Pencil Puzzle Bench - Double Choco0Direct-ask Success Rate (%)49
Pencil Puzzle Bench - Kurodoko0Direct-ask Success Rate (%)48
Pencil Puzzle Bench - Firefly0Direct-ask Success Rate (%)46
Pencil Puzzle Bench - Sudoku0Direct-ask Success Rate (%)46
WeirdML41.17Average Score43.1
Pencil Puzzle Bench - Yajilin0Direct-ask Success Rate (%)43
Bullshit Benchmark20BS Detection Rate (%)42.2

Interactive version: theaggregate.ai/model?slug=qwen3-coder · How the rankings work · Data refreshed daily, snapshot 2026-07-22.