Qwen 3.5 2B (Reasoning) — benchmark results

Provider: Alibaba. Released 2026-03-02. Access: Open.

Unified ELO 1368 ± 46, rank #1402 of 1841 rated models, from 37 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA TAU-2 Bench69.01Accuracy (%)61.9
AA Omniscience-47.48Score41.3
AA Long Context Reasoning23.67Accuracy (%)35
CritPt0Accuracy (self-reported)30.3
AA CritPt0Accuracy (%)26.8
AA Terminal-Bench Hard3.79Accuracy (%)25.6
AA Omniscience - Software Engineering (SWE) - Julia4Accuracy (%)23.5
Artificial Analysis Intelligence Index6.86Intelligence Index20.4
AA IFBench30.41Accuracy (%)14.7
AA MATH-50042.96Accuracy (%)11.2
AA GDPval219.82ELO10.9
GDPval-AA220Elo10.6

Interactive version: theaggregate.ai/model?slug=qwen-3-5-2b-reasoning · How It Works · Data refreshed daily, snapshot 2026-07-25.