Qwen 3.5 0.8B (Thinking) — benchmark results

Provider: Alibaba. Released 2026-03-02. Access: Open.

Unified ELO 1221 ± 65, rank #1663 of 1776 rated models, from 38 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience-35.18Score58.5
MedLayXPlain58.2S (self-reported)51.6
AA TAU-2 Bench47.66Accuracy (%)51.4
CritPt0Accuracy (self-reported)30.3
AA CritPt0Accuracy (%)27.1
Artificial Analysis Intelligence Index5.48Intelligence Index16.8
AA Long Context Reasoning5.33Accuracy (%)16.7
AA Omniscience - Software Engineering (SWE) - Julia0Accuracy (%)7.9
GDPval-AA111Elo6.5
AA Terminal-Bench Hard0Accuracy (%)5.5
AA Omniscience - Software Engineering (SWE) - Dart4Accuracy (%)3.3
AA IFBench21.63Accuracy (%)3.1

Interactive version: theaggregate.ai/model?slug=qwen-3-5-0-8b-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.