Qwen 2 VL 7B — benchmark results

Alibaba's Apache-2.0 7B vision-language model (August 2024) handling image, multi-image, and video input at a cost-effective size. Provider: Alibaba. Released 2024-08-29. Access: Open.

Unified ELO 1487 ± 6, rank #852 of 1776 rated models, from 1046 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MEGA-Bench Task - VLN English Next Step40Task Score (%)100
MEGA-Bench Task - Weather Info Parsing97.2Task Score (%)100
OpenVLM VCR75.6Overall Jaccard (%)100
OpenVLM MMT-Bench - Traffic Sign Understanding100Score (%)99.8
OpenVLM MMT-Bench - Religious Recognition90Score (%)99.5
OpenVLM MMT-Bench - Pixel Localization60Score (%)99.3
MEGA-Bench Task - Autorater Subject71.4Task Score (%)98.8
OpenVLM MMT-Bench - Artwork Emotion Recognition65Score (%)98.8
OpenVLM MMT-Bench - Attribute Hallucination90Score (%)98.8
OpenVLM MMT-Bench - Salient Object Detection RGB85Score (%)98.3
OpenVLM MMT-Bench - AUD68Score (%)97.8
MEGA-Bench Task - Electricity Future Prediction From Table77.3Task Score (%)97.7

Interactive version: theaggregate.ai/model?slug=qwen-2-vl-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.