Qwen 3.6 35B A3B (Thinking): benchmark results
Provider: Alibaba. Released 2026-04-16. Access: Open.
Unified ELO 1601 ± 1, rank #398 of 2032 rated models, from 75 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| K-MetBench | 82.9 | Accuracy (self-reported) | 93.1 |
| Nejumi 4 - Toxicity - Violation Categories | 55.56 | Criteria met (%) | 93 |
| Nejumi 4 - MT-Bench (Japanese) - Writing | 98.5 | Judge rating (1-10, x10) | 91.5 |
| Nejumi 4 - Toxicity - Social Norms | 98.81 | Criteria met (%) | 90.8 |
| Nejumi 4 - MT-Bench (Japanese) - Humanities | 100 | Judge rating (1-10, x10) | 90.4 |
| Nejumi 4 - Toxicity - Prohibited Acts | 97.4 | Criteria met (%) | 89.7 |
| Nejumi 4 - jaster (0-shot) - JSICK | 83 | Exact match (%) | 84.6 |
| Nejumi 4 - BFCL - Live AST | 73.15 | Accuracy (%) | 82.4 |
| Nejumi 4 - BFCL - Irrelevance Detection | 90 | Accuracy (%) | 82 |
| Nejumi 4 - Toxicity - Fairness | 98.31 | Criteria met (%) | 82 |
| Nejumi 4 - jaster (0-shot) - JSeM | 79 | Exact match (%) | 74.6 |
| Nejumi 4 - jaster (2-shot) - JSICK | 82 | Exact match (%) | 72.1 |
Interactive version: theaggregate.ai/model?slug=qwen-3-6-35b-a3b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-26.