Q-Bench A2 Pair — leaderboard
Metric: Sum Score. Source: huggingface.co. 9 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | BlueImage-GPT (Close-Source) | 4.53 |
| 2 | mPLUG-Owl2 (Q-Instruct) | 3.69 |
| 3 | mPLUG-Owl2 (LLaMA-7B) | 3.5 |
| 4 | LLaVA-v1.5 (Vicuna-v1.5-13B) | 3.44 |
| 5 | BakLLava (Mistral-7B) | 3.4 |
| 6 | InfiMM (Zephyr-7B) | 3.28 |
| 7 | LLaVA-v1.5 (Vicuna-v1.5-7B) | 3.22 |
| 8 | Fuyu-8B (Persimmon-8B) | 3.12 |
| 9 | Emu2-Chat (LLaMA-33B) | 3.03 |
Interactive version: theaggregate.ai/benchmark?slug=q-bench-a2-pair · How the rankings work · Data refreshed daily, snapshot 2026-07-22.