Qwen 3.5 0.8B (Non-reasoning): benchmark results
Provider: Alibaba. Released 2026-03-02. Access: Open.
Unified ELO 1401 ± 1, rank #2485 of 3078 rated models, from 52 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Tau2-Bench Telecom | 65.2 | Success Rate (%) | 60.5 |
| AA TAU-2 Bench | 65.2 | Accuracy (%) | 59.1 |
| AA Humanity's Last Exam | 5.1 | Accuracy (%) | 31.2 |
| AA Omniscience - Software Engineering (SWE) - Julia | 4 | Accuracy (%) | 30.4 |
| AA CritPt | 0 | Accuracy (%) | 23.9 |
| AA Omniscience - Software Engineering (SWE) - Go | 8 | Accuracy (%) | 20 |
| AA Omniscience - Software Engineering (SWE) - Java | 9 | Accuracy (%) | 18.8 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 7.78 | Accuracy (%) | 16.2 |
| AA Long Context Reasoning | 8 | Accuracy (%) | 15.2 |
| AA Omniscience - Software Engineering (SWE) - Dart | 8 | Accuracy (%) | 11.4 |
| AA Omniscience - Software Engineering (SWE) - HTML | 14 | Accuracy (%) | 11.3 |
| FrameBench - Frame Identification - English | 49.5 | Accuracy (%; FrameNet candidate frames) | 10.5 |
Interactive version: theaggregate.ai/model?slug=qwen-3-5-0-8b-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.