Qwen 3 VL 235B A22B: benchmark results
Alibaba's open Qwen 3-VL 235B sparse MoE (22B active) vision-language model (September 2025). Provider: Alibaba. Released 2025-09-22. Access: Open.
Unified ELO 1612 ± 1, rank #228 of 1392 rated models, from 48 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| SciEval - Physics | 49.93 | Physics (%) | 100 |
| MMMU Benchmark | 78.7 | Validation Score | 94.2 |
| Diagram-MMU - Code Parsing | 55.98 | All Score (%) | 90.9 |
| GeoSym-Bench | 77.34 | Overall (self-reported) | 90.5 |
| Diagram-MMU - Code Editing | 52.25 | All Score (%) | 90 |
| EviSafe - Natural Severity Accuracy | 51.9 | Accuracy (%) | 90 |
| VeriTrip | 68.26 | DR (Simple) (self-reported) | 90 |
| SGI-Bench Wet Experiment | 30.3 | Wet Experiment Score | 77.8 |
| SciEval - Chemistry | 77.39 | Chemistry (%) | 77.8 |
| SciEval - Life Sciences | 56.69 | Life Sciences (%) | 77.8 |
| SciEval - Overall | 60.58 | Overall (%) | 77.8 |
| IDP Leaderboard | 76.8 | Avg Score (%) | 72 |
Interactive version: theaggregate.ai/model?slug=qwen-3-vl-235b-a22b · How It Works · Data refreshed daily, snapshot 2026-09-05.