Qwen 3.5 27B (Thinking): benchmark results

Provider: Alibaba. Released 2026-02-24. Access: Open.

Unified ELO 1641 ± 1, rank #385 of 3078 rated models, from 128 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - Toxicity - Prohibited Acts99.48Criteria met (%)98.9
Swallow - Japanese MT-Bench - Reasoning84.7Judge Score (normalized, %)98.5
Swallow - Post-trained English - GPQA Diamond86.6Accuracy (%)98.5
CPTU Bench4.34Average Score (1-5)97
Swallow - Post-trained English - HellaSwag95.7Accuracy (%)97
Swallow - Post-trained Japanese - GPQA79.5Accuracy (%)96.3
Swallow - Post-trained English - MMLU-Pro86.8Accuracy (%)95.5
K-MetBench83Accuracy (self-reported)94.8
Swallow - Post-trained Japanese - PolyMath High and Top59.2Accuracy (%)94
Nejumi 4 - Toxicity - Fairness99.44Criteria met (%)93.8
Swallow - Post-trained English - AIME89.2Accuracy (%)93.3
Swallow - Post-trained Japanese - MMLU-ProX83.5Accuracy (%)93.3

Interactive version: theaggregate.ai/model?slug=qwen-3-5-27b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.