Qwen 3.5 4B (Non-reasoning): benchmark results

Qwen 3.5 4B evaluated with reasoning disabled. Provider: Alibaba. Released 2026-03-01. Access: Open.

Unified ELO 1494 ± 1, rank #892 of 1761 rated models, from 37 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA TAU-2 Bench87.72Accuracy (%)81.9
AA Omniscience - Software Engineering (SWE) - Dart18Accuracy (%)51.5
AA GPQA Diamond71.21Accuracy (%)50
AA Humanity's Last Exam7.97Accuracy (%)48.9
Artificial Analysis Intelligence Index10.02Intelligence Index47.3
AA Terminal-Bench Hard11.36Accuracy (%)46.8
AA Omniscience - Software Engineering (SWE) - Julia8Accuracy (%)46.1
AA Omniscience - Software Engineering (SWE) - JavaScript25.45Accuracy (%)42
OTIS Mock AIME 2024-2555.83Accuracy (%)42
AA Omniscience - Software Engineering (SWE) - R6Accuracy (%)36.2
AA Long Context Reasoning34.67Accuracy (%)35.7
UGI - Writing29.68Writing Score35.4

Interactive version: theaggregate.ai/model?slug=qwen-3-5-4b-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.