Qwen 3.5 Flash (02-23): benchmark results
Provider: Alibaba. Released 2026-02-16. Access: API.
Unified ELO 1790 ± 29, rank #168 of 2656 rated models, from 80 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - grapheval_iclr | 2.04 | Dataset z-score | 100 |
| AGC-Bench - lcc_metaphor | 1.34 | Dataset z-score | 100 |
| AGC-Bench - proparalogy | 0.95 | Dataset z-score | 100 |
| AGC-Bench - ss_gen | 1.38 | Dataset z-score | 98.8 |
| AGC-Bench - STEM | 0.67 | JRT z-score | 96.3 |
| AGC-Bench - ttcw | 1.77 | Dataset z-score | 95.1 |
| AGC-Bench - conceptual_design | 1.23 | Dataset z-score | 91.5 |
| AGC-Bench - cue_word_story | 0.96 | Dataset z-score | 90.9 |
| AGC-Bench - chinese_homophonic_puns | 1.18 | Dataset z-score | 90.1 |
| Story Theory Bench | 98.6 | Score (%) | 88.2 |
| AGC-Bench - arn | 0.71 | Dataset z-score | 87.8 |
| AGC-Bench - cpers | 0.95 | Dataset z-score | 87.8 |
Interactive version: theaggregate.ai/model?slug=qwen-3-5-flash-02-23 · How It Works · Data refreshed daily, snapshot 2026-09-19.