Qwen 3 VL 235B A22B (Thinking): benchmark results

Alibaba Qwen 3 VL 235B A22B vision-language model evaluated with thinking enabled. Provider: Alibaba. Released 2025-09-22. Access: Open.

Unified ELO 1576 ± 1, rank #529 of 1761 rated models, from 169 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CFMME66.11Average (self-reported)100
FlagEval EmbodiedVerse - EmbSpatial-Bench83.49Score100
FlagEval EmbodiedVerse - RoboSpatial-Home69.19Score100
LLM Stats (OCRBench-V2 (zh))63.5Score (%)100
LLM Stats (ZebraLogic)97.3Score (%)100
Math-VR66.8Overall Answer Correctness (self-reported)100
PCB-Bench - Task 3 BERTScore82.93BERTScore (%)100
PCB-Bench - Task 3 SBERT61.68SBERT similarity (%)100
K-MetBench84.4Accuracy (self-reported)96.6
FlagEval EmbodiedVerse - All-Angles Bench61.12Score95.7
FlagEval EmbodiedVerse - VSI-Bench (tiny)54.74Score95.7
FlagEval EmbodiedVerse - Where2Place52.61Score91.3

Interactive version: theaggregate.ai/model?slug=qwen-3-vl-235b-a22b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.