Qwen 3 VL 30B A3B (Thinking) — benchmark results

Alibaba Qwen 3 VL 30B A3B vision-language model evaluated with thinking enabled. Provider: Alibaba. Released 2025-07-01. Access: Open.

Unified ELO 1582 ± 12, rank #525 of 1776 rated models, from 122 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Medmarks - PubMedQA78.53Score (%)95.7
SnakeBench32.5TrueSkill Rating92.1
MedLayXPlain64.8S (self-reported)90.3
Medmarks - SuperGPQA Medicine Easy58.82Score (%)84.3
SWE-Arena1002Elo Score80.6
LLM Stats (MuirBench)77.6Score (%)80
Medmarks - HEAD-QA v287.5Score (%)80
AA LiveCodeBench69.74Pass@1 (%)79.8
Medmarks - CareQA EN90.11Score (%)78.6
Medmarks - Med-HALT Reasoning NOTA66.97Score (%)78.6
K-MetBench74.9Accuracy (self-reported)78.4
AA AIME 202582.33Accuracy (%)78.3

Interactive version: theaggregate.ai/model?slug=qwen-3-vl-30b-a3b-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.