Qwen 3.6 27B (Thinking): benchmark results

Provider: Alibaba. Released 2026-04-22. Access: Open.

Unified ELO 1654 ± 1, rank #322 of 3078 rated models, from 84 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - jaster (0-shot) - JSQuAD83Character F1 (x100)99.3
Nejumi 4 - Toxicity - Social Norms99.6Criteria met (%)98.5
Nejumi 4 - BFCL - Live AST75.93Accuracy (%)97.1
Nejumi 4 - Toxicity - Prohibited Acts98.44Criteria met (%)96.3
Nejumi 4 - jaster (2-shot) - JSQuAD81.92Character F1 (x100)96.3
Nejumi 4 - jaster (2-shot) - JSeM83Exact match (%)96.3
Nejumi 4 - jaster (0-shot) - JSeM82Exact match (%)94.9
Nejumi 4 - MT-Bench (Japanese) - Humanities100Judge rating (1-10, x10)90.4
Nejumi 4 - MT-Bench (Japanese) - STEM100Judge rating (1-10, x10)90.4
Nejumi 4 - jaster (0-shot) - JCoLA (out-of-domain)88Exact match (%)86.4
Nejumi 4 - MT-Bench (Japanese) - Writing98Judge rating (1-10, x10)84.9
Nejumi 4 - BFCL - Multi-Turn54.44Accuracy (%)81.2

Interactive version: theaggregate.ai/model?slug=qwen-3-6-27b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.