Q-Bench A1 Pair Test — leaderboard
Metric: Overall Accuracy (%). Source: huggingface.co. 13 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | BlueImage-GPT (Close-Source) | 83.48 |
| 2 | GPT-4V (Close-Source) | 78.07 |
| 3 | Qwen-VL-Max (Close-Source) | 66.99 |
| 4 | Qwen-VL-Plus (Close-Source) | 61.48 |
| 5 | Gemini-Pro (Close-Source) | 60.46 |
| 6 | mPLUG-Owl2 (Q-Instruct) | 53.15 |
| 7 | BakLLava (Mistral-7B) | 52.75 |
| 8 | LLaVA-v1.5 (Vicuna-v1.5-7B) | 52.25 |
| 9 | LLaVA-v1.5 (Vicuna-v1.5-13B) | 52.05 |
| 10 | mPLUG-Owl2 (LLaMA-7B) | 48.94 |
Interactive version: theaggregate.ai/benchmark?slug=q-bench-a1-pair-test · How the rankings work · Data refreshed daily, snapshot 2026-07-22.