Qwen 3.5 4B (Reasoning) — benchmark results

Provider: Alibaba. Released 2026-03-01. Access: Open.

Unified ELO 1572 ± 42, rank #583 of 1841 rated models, from 35 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA TAU-2 Bench92.11Accuracy (%)87.4
AA Long Context Reasoning55.67Accuracy (%)65.1
AA IFBench50.2Accuracy (%)59.9
Artificial Analysis Intelligence Index20.09Intelligence Index59.6
AA Terminal-Bench Hard18.18Accuracy (%)57.3
AA Humanity's Last Exam7.83Accuracy (%)53.9
AA GPQA Diamond67.98Accuracy (%)48.8
AA MMMU-Pro65.38Accuracy (%)47.4
AA Omniscience - Science, Engineering & Mathematics23.5Accuracy (%)38.9
Tau3 Banking8.25Success Rate (%)38.8
AA Omniscience - Software Engineering (SWE) - Julia8Accuracy (%)36.9
AA MATH-50073.08Accuracy (%)35

Interactive version: theaggregate.ai/model?slug=qwen-3-5-4b-reasoning · How It Works · Data refreshed daily, snapshot 2026-07-25.