Q-Bench A1 Single Test — leaderboard
Metric: Overall Accuracy (%). Source: huggingface.co. 25 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | BlueImage-GPT (Close-Source) | 83.48 |
| 2 | GPT-4V (Close-Source) | 74.1 |
| 3 | Qwen-VL-Max (Close-Source) | 73.9 |
| 4 | Gemini-Pro (Close-Source) | 69.46 |
| 5 | Qwen-VL-Plus (Close-Source) | 68.93 |
| 6 | SPHINX | 67.69 |
| 7 | InternLM-XComposer-VL (InternLM) | 64.35 |
| 8 | Emu2-Chat (LLaMA-33B) | 64.32 |
| 9 | mPLUG-Owl2 (LLaMA-7B) | 62.68 |
| 10 | InstructBLIP (Flan-T5-XL) | 61.94 |
Interactive version: theaggregate.ai/benchmark?slug=q-bench-a1-single-test · How the rankings work · Data refreshed daily, snapshot 2026-07-22.