Q-Bench A2 Pair — leaderboard

Metric: Sum Score. Source: huggingface.co. 9 models tracked.

Top models

#ModelScore
1BlueImage-GPT (Close-Source)4.53
2mPLUG-Owl2 (Q-Instruct)3.69
3mPLUG-Owl2 (LLaMA-7B)3.5
4LLaVA-v1.5 (Vicuna-v1.5-13B)3.44
5BakLLava (Mistral-7B)3.4
6InfiMM (Zephyr-7B)3.28
7LLaVA-v1.5 (Vicuna-v1.5-7B)3.22
8Fuyu-8B (Persimmon-8B)3.12
9Emu2-Chat (LLaMA-33B)3.03

Interactive version: theaggregate.ai/benchmark?slug=q-bench-a2-pair · How the rankings work · Data refreshed daily, snapshot 2026-07-22.