Qwen 3 VL 8B (Thinking): benchmark results

Alibaba Qwen 3 VL 8B vision-language model evaluated with thinking enabled. Provider: Alibaba. Released 2025-07-01. Access: Open.

Unified ELO 1511 ± 1, rank #800 of 1761 rated models, from 100 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OCR-Robust79.67OCR1.0 Clean (self-reported)94.1
MedLayXPlain64.6S (self-reported)83.9
JMeetEval65.5Prompt-level strict accuracy (%)83.3
CritPt30Accuracy (self-reported)80.8
AA Omniscience - Software Engineering (SWE) - Rust58Accuracy (%)77.6
AA Omniscience - Software Engineering (SWE) - PHP32Accuracy (%)75.9
JMeetEval - Instruction Level80.6Instruction-level strict accuracy (%)75
MathVision59.6Overall Accuracy (%)74.4
AA Omniscience - Software Engineering (SWE) - Go24Accuracy (%)74.1
CFMME53.85Average (self-reported)73.3
LLM Stats (MuirBench)76.8Score (%)72.7
AA Omniscience - Software Engineering (SWE) - Kotlin24Accuracy (%)72.5

Interactive version: theaggregate.ai/model?slug=qwen-3-vl-8b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.