Qwen 3.5 27B (Thinking): benchmark results
Provider: Alibaba. Released 2026-02-24. Access: Open.
Unified ELO 1641 ± 1, rank #385 of 3078 rated models, from 128 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - Toxicity - Prohibited Acts | 99.48 | Criteria met (%) | 98.9 |
| Swallow - Japanese MT-Bench - Reasoning | 84.7 | Judge Score (normalized, %) | 98.5 |
| Swallow - Post-trained English - GPQA Diamond | 86.6 | Accuracy (%) | 98.5 |
| CPTU Bench | 4.34 | Average Score (1-5) | 97 |
| Swallow - Post-trained English - HellaSwag | 95.7 | Accuracy (%) | 97 |
| Swallow - Post-trained Japanese - GPQA | 79.5 | Accuracy (%) | 96.3 |
| Swallow - Post-trained English - MMLU-Pro | 86.8 | Accuracy (%) | 95.5 |
| K-MetBench | 83 | Accuracy (self-reported) | 94.8 |
| Swallow - Post-trained Japanese - PolyMath High and Top | 59.2 | Accuracy (%) | 94 |
| Nejumi 4 - Toxicity - Fairness | 99.44 | Criteria met (%) | 93.8 |
| Swallow - Post-trained English - AIME | 89.2 | Accuracy (%) | 93.3 |
| Swallow - Post-trained Japanese - MMLU-ProX | 83.5 | Accuracy (%) | 93.3 |
Interactive version: theaggregate.ai/model?slug=qwen-3-5-27b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.