Qwen 3.6 35B A3B (Thinking): benchmark results

Provider: Alibaba. Released 2026-04-16. Access: Open.

Unified ELO 1601 ± 1, rank #398 of 2032 rated models, from 75 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
K-MetBench82.9Accuracy (self-reported)93.1
Nejumi 4 - Toxicity - Violation Categories55.56Criteria met (%)93
Nejumi 4 - MT-Bench (Japanese) - Writing98.5Judge rating (1-10, x10)91.5
Nejumi 4 - Toxicity - Social Norms98.81Criteria met (%)90.8
Nejumi 4 - MT-Bench (Japanese) - Humanities100Judge rating (1-10, x10)90.4
Nejumi 4 - Toxicity - Prohibited Acts97.4Criteria met (%)89.7
Nejumi 4 - jaster (0-shot) - JSICK83Exact match (%)84.6
Nejumi 4 - BFCL - Live AST73.15Accuracy (%)82.4
Nejumi 4 - BFCL - Irrelevance Detection90Accuracy (%)82
Nejumi 4 - Toxicity - Fairness98.31Criteria met (%)82
Nejumi 4 - jaster (0-shot) - JSeM79Exact match (%)74.6
Nejumi 4 - jaster (2-shot) - JSICK82Exact match (%)72.1

Interactive version: theaggregate.ai/model?slug=qwen-3-6-35b-a3b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-26.