Qwen 3.5 4B (Reasoning): benchmark results
Provider: Alibaba. Released 2026-03-02. Access: Open.
Unified ELO 1562 ± 1, rank #950 of 3363 rated models, from 171 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA TAU-2 Bench | 92.11 | Accuracy (%) | 87.5 |
| Tau2-Bench Telecom | 92.11 | Success Rate (%) | 87.2 |
| SEA-HELM (Burmese) - Summarization | 23.46 | Normalized Score | 86 |
| SEA-HELM (English) - AA-LCR | 63.08 | Normalized Score | 84.2 |
| SEA-HELM (Indonesian) - Natural Language Inference | 80.52 | Normalized Score | 80.7 |
| SEA-HELM (Tamil) - SEA-IFEval | 85.17 | Normalized Score | 77.2 |
| SEA-HELM (Burmese) - SEA-IFEval | 71.84 | Normalized Score | 75.4 |
| SEA-HELM (Vietnamese) - SEA-IFEval | 90.9 | Normalized Score | 75.4 |
| SEA-HELM (Thai) - Safety | 54.56 | Normalized Score | 74.6 |
| SEA-HELM (Thai) - Thai Exam | 65.89 | Normalized Score | 73.7 |
| SEA-HELM (Burmese) - Global MMLU Lite | 50.71 | Normalized Score | 71.9 |
| SEA-HELM (English) - Knowledge | 61.83 | Normalized Score | 71.9 |
Interactive version: theaggregate.ai/model?slug=qwen-3-5-4b-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-23.