Qwen 3.5 4B (Non-reasoning) — benchmark results

Qwen 3.5 4B evaluated with reasoning disabled. Provider: Alibaba. Released 2026-03-01. Access: Open.

Unified ELO 1525 ± 36, rank #702 of 1776 rated models, from 39 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA TAU-2 Bench87.72Accuracy (%)81.8
AA GPQA Diamond71.21Accuracy (%)54.7
AA Humanity's Last Exam7.46Accuracy (%)53.2
Artificial Analysis Intelligence Index16Intelligence Index51.1
AA-LCR28.3Score (self-reported)47.9
AA Terminal-Bench Hard11.36Accuracy (%)46.8
AA Long Context Reasoning28.33Accuracy (%)39.5
AA MMMU-Pro62.08Accuracy (%)37.5
AA Omniscience - Software Engineering (SWE) - Julia8Accuracy (%)37.3
UGI - Writing29.68Writing Score35.8
AA Omniscience - Software Engineering (SWE) - JavaScript24.55Accuracy (%)33.9
AA Omniscience - Software Engineering (SWE) - Dart16Accuracy (%)33.7

Interactive version: theaggregate.ai/model?slug=qwen-3-5-4b-non-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.