Qwen 3.6 27B (Thinking): benchmark results
Provider: Alibaba. Released 2026-04-22. Access: Open.
Unified ELO 1654 ± 1, rank #322 of 3078 rated models, from 84 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - jaster (0-shot) - JSQuAD | 83 | Character F1 (x100) | 99.3 |
| Nejumi 4 - Toxicity - Social Norms | 99.6 | Criteria met (%) | 98.5 |
| Nejumi 4 - BFCL - Live AST | 75.93 | Accuracy (%) | 97.1 |
| Nejumi 4 - Toxicity - Prohibited Acts | 98.44 | Criteria met (%) | 96.3 |
| Nejumi 4 - jaster (2-shot) - JSQuAD | 81.92 | Character F1 (x100) | 96.3 |
| Nejumi 4 - jaster (2-shot) - JSeM | 83 | Exact match (%) | 96.3 |
| Nejumi 4 - jaster (0-shot) - JSeM | 82 | Exact match (%) | 94.9 |
| Nejumi 4 - MT-Bench (Japanese) - Humanities | 100 | Judge rating (1-10, x10) | 90.4 |
| Nejumi 4 - MT-Bench (Japanese) - STEM | 100 | Judge rating (1-10, x10) | 90.4 |
| Nejumi 4 - jaster (0-shot) - JCoLA (out-of-domain) | 88 | Exact match (%) | 86.4 |
| Nejumi 4 - MT-Bench (Japanese) - Writing | 98 | Judge rating (1-10, x10) | 84.9 |
| Nejumi 4 - BFCL - Multi-Turn | 54.44 | Accuracy (%) | 81.2 |
Interactive version: theaggregate.ai/model?slug=qwen-3-6-27b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.