Q-Bench A1 Pair Test — leaderboard

Metric: Overall Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1BlueImage-GPT (Close-Source)83.48
2GPT-4V (Close-Source)78.07
3Qwen-VL-Max (Close-Source)66.99
4Qwen-VL-Plus (Close-Source)61.48
5Gemini-Pro (Close-Source)60.46
6mPLUG-Owl2 (Q-Instruct)53.15
7BakLLava (Mistral-7B)52.75
8LLaVA-v1.5 (Vicuna-v1.5-7B)52.25
9LLaVA-v1.5 (Vicuna-v1.5-13B)52.05
10mPLUG-Owl2 (LLaMA-7B)48.94

Interactive version: theaggregate.ai/benchmark?slug=q-bench-a1-pair-test · How the rankings work · Data refreshed daily, snapshot 2026-07-22.