Qwen 2 VL 7B — benchmark results
Alibaba's Apache-2.0 7B vision-language model (August 2024) handling image, multi-image, and video input at a cost-effective size. Provider: Alibaba. Released 2024-08-29. Access: Open.
Unified ELO 1487 ± 6, rank #852 of 1776 rated models, from 1046 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MEGA-Bench Task - VLN English Next Step | 40 | Task Score (%) | 100 |
| MEGA-Bench Task - Weather Info Parsing | 97.2 | Task Score (%) | 100 |
| OpenVLM VCR | 75.6 | Overall Jaccard (%) | 100 |
| OpenVLM MMT-Bench - Traffic Sign Understanding | 100 | Score (%) | 99.8 |
| OpenVLM MMT-Bench - Religious Recognition | 90 | Score (%) | 99.5 |
| OpenVLM MMT-Bench - Pixel Localization | 60 | Score (%) | 99.3 |
| MEGA-Bench Task - Autorater Subject | 71.4 | Task Score (%) | 98.8 |
| OpenVLM MMT-Bench - Artwork Emotion Recognition | 65 | Score (%) | 98.8 |
| OpenVLM MMT-Bench - Attribute Hallucination | 90 | Score (%) | 98.8 |
| OpenVLM MMT-Bench - Salient Object Detection RGB | 85 | Score (%) | 98.3 |
| OpenVLM MMT-Bench - AUD | 68 | Score (%) | 97.8 |
| MEGA-Bench Task - Electricity Future Prediction From Table | 77.3 | Task Score (%) | 97.7 |
Interactive version: theaggregate.ai/model?slug=qwen-2-vl-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.