Qwen 3 VL 4B (Thinking): benchmark results

Alibaba Qwen 3 VL 4B vision-language model evaluated with thinking enabled. Provider: Alibaba. Released 2025-07-01. Access: Open.

Unified ELO 1446 ± 1, rank #1123 of 1761 rated models, from 85 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OCR-Robust78.63OCR1.0 Clean (self-reported)82.4
MedLayXPlain63.3S (self-reported)74.2
LLM Stats (MuirBench)75Score (%)63.6
K-MetBench66.1Accuracy (self-reported)62.1
Video-MMMU69.4Overall Score55.1
LLM Stats (Hallusion Bench)64.1Score (%)52.9
AA Omniscience - Software Engineering (SWE) - Swift32Accuracy (%)51.2
LLM Stats (MMStar)73.2Score (%)50
LLM Stats (Multi-IF)73.6Score (%)50
AA Omniscience - Software Engineering (SWE) - JavaScript27.27Accuracy (%)48.3
RealWorldQA73.2RealWorldQA (self-reported)47.2
AA Omniscience - Software Engineering (SWE) - Dart16Accuracy (%)43.7

Interactive version: theaggregate.ai/model?slug=qwen-3-vl-4b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.