Qwen 3.5 0.8B (Thinking): benchmark results

Provider: Alibaba. Released 2026-03-02. Access: Open.

Unified ELO 1371 ± 1, rank #2732 of 3078 rated models, from 88 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA-Omniscience Hallucination Rate61.35Hallucination Rate (%)74.3
Tau2-Bench Telecom47.66Success Rate (%)53
MedLayXPlain58.2S (self-reported)51.6
AA TAU-2 Bench47.66Accuracy (%)51.4
AA-Omniscience Index - Law-49.7Omniscience Index43.1
AA-Omniscience Index - Software Engineering (SWE) - Java-60Omniscience Index39.1
AA-Omniscience Index - Business-50.2Omniscience Index33.3
AA-Omniscience Index - Science, Engineering & Mathematics-43.5Omniscience Index29
AA-Omniscience Index - Software Engineering (SWE) - TypeScript-63.33Omniscience Index28.8
AA-Omniscience Index - Humanities & Social Sciences-54.2Omniscience Index28.5
AA-Omniscience Index - Software Engineering (SWE) - Julia-76Omniscience Index27.6
AA Omniscience-54.52Score25.2

Interactive version: theaggregate.ai/model?slug=qwen-3-5-0-8b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.