Qwen 3 VL 30B A3B (Thinking): benchmark results

Alibaba Qwen 3 VL 30B A3B vision-language model evaluated with thinking enabled. Provider: Alibaba. Released 2025-07-01. Access: Open.

Unified ELO 1516 ± 1, rank #764 of 1761 rated models, from 135 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Medmarks - PubMedQA78.53Score (%)95.7
SnakeBench32.5TrueSkill Rating92.1
MedLayXPlain64.8S (self-reported)90.3
Medmarks - SuperGPQA Medicine Easy58.82Score (%)84.3
FlagEval EmbodiedVerse - RoboSpatial-Home58.93Score82.6
LLM Stats (MuirBench)77.6Score (%)81.8
SWE-Arena1002Elo Score80.6
Medmarks - HEAD-QA v287.5Score (%)80
Medmarks - CareQA EN90.11Score (%)78.6
Medmarks - Med-HALT Reasoning NOTA66.97Score (%)78.6
K-MetBench74.9Accuracy (self-reported)78.4
FlagEval EmbodiedVerse - CV-Bench (test)86.7Score78.3

Interactive version: theaggregate.ai/model?slug=qwen-3-vl-30b-a3b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.