Qwen 3.5 9B (Reasoning): benchmark results

Provider: Alibaba. Released 2026-03-02. Access: Open.

Unified ELO 1568 ± 1, rank #565 of 1761 rated models, from 37 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CritPt30Accuracy (self-reported)80.8
AA TAU-2 Bench86.84Accuracy (%)80.2
AA IFBench66.73Accuracy (%)79.7
AA GPQA Diamond80.61Accuracy (%)67.8
AA Long Context Reasoning70Accuracy (%)67.1
AA Humanity's Last Exam14.92Accuracy (%)66.1
AA Terminal-Bench Hard24.24Accuracy (%)64.5
AA Omniscience - Science, Engineering & Mathematics31.75Accuracy (%)62.9
AA Omniscience - Software Engineering (SWE) - Swift36Accuracy (%)60.6
Artificial Analysis Intelligence Index14.76Intelligence Index57.6
AA Omniscience - Software Engineering (SWE) - Java16Accuracy (%)57
AA Omniscience - Software Engineering (SWE) - Kotlin18Accuracy (%)55.3

Interactive version: theaggregate.ai/model?slug=qwen-3-5-9b-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.