Qwen 3 VL 235B A22B (Thinking) — benchmark results

Alibaba Qwen 3 VL 235B A22B vision-language model evaluated with thinking enabled. Provider: Alibaba. Released 2025-09-22. Access: Open.

Unified ELO 1622 ± 14, rank #432 of 1776 rated models, from 137 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CFMME66.11Average (self-reported)100
LLM Stats (OCRBench-V2 (zh))63.5Score (%)100
LLM Stats (ZebraLogic)97.3Score (%)100
Math-VR66.8Overall Answer Correctness (self-reported)100
PCB-Bench - Task 3 BERTScore82.93BERTScore (%)100
PCB-Bench - Task 3 SBERT61.68SBERT similarity (%)100
K-MetBench84.4Accuracy (self-reported)96.6
YapBench666.3YapIndex (lower is better)94.2
LLM Stats (InfoVQAtest)89.5Score (%)90.9
LLM Stats (MuirBench)80.1Score (%)90
LLM Stats (Multi-IF)79.1Score (%)89.5
VisuLogic34.4Overall Accuracy (%)87.5

Interactive version: theaggregate.ai/model?slug=qwen-3-vl-235b-a22b-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.