Q-Bench A1 Single Test — leaderboard

Metric: Overall Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1BlueImage-GPT (Close-Source)83.48
2GPT-4V (Close-Source)74.1
3Qwen-VL-Max (Close-Source)73.9
4Gemini-Pro (Close-Source)69.46
5Qwen-VL-Plus (Close-Source)68.93
6SPHINX67.69
7InternLM-XComposer-VL (InternLM)64.35
8Emu2-Chat (LLaMA-33B)64.32
9mPLUG-Owl2 (LLaMA-7B)62.68
10InstructBLIP (Flan-T5-XL)61.94

Interactive version: theaggregate.ai/benchmark?slug=q-bench-a1-single-test · How the rankings work · Data refreshed daily, snapshot 2026-07-22.