Qwen 3.5 4B (Reasoning): benchmark results

Provider: Alibaba. Released 2026-03-02. Access: Open.

Unified ELO 1562 ± 1, rank #950 of 3363 rated models, from 171 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA TAU-2 Bench92.11Accuracy (%)87.5
Tau2-Bench Telecom92.11Success Rate (%)87.2
SEA-HELM (Burmese) - Summarization23.46Normalized Score86
SEA-HELM (English) - AA-LCR63.08Normalized Score84.2
SEA-HELM (Indonesian) - Natural Language Inference80.52Normalized Score80.7
SEA-HELM (Tamil) - SEA-IFEval85.17Normalized Score77.2
SEA-HELM (Burmese) - SEA-IFEval71.84Normalized Score75.4
SEA-HELM (Vietnamese) - SEA-IFEval90.9Normalized Score75.4
SEA-HELM (Thai) - Safety54.56Normalized Score74.6
SEA-HELM (Thai) - Thai Exam65.89Normalized Score73.7
SEA-HELM (Burmese) - Global MMLU Lite50.71Normalized Score71.9
SEA-HELM (English) - Knowledge61.83Normalized Score71.9

Interactive version: theaggregate.ai/model?slug=qwen-3-5-4b-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-23.