MMBU - Ungrounded Classification: leaderboard

Metric: Closed-ended (multiple-choice) ungrounded classification of the whole image: micro-averaged F1 x100 (0-100) over MMBU's biomedical images from 35 submodalities (95% bootstrap intervals not published); zero-shot, official checkpoints; exact match after normalization. Source: arxiv.org. Saturation forecast: Around December 2026. 17 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini53.9
2GPT-5.4 Mini53.3
3Qwen 3 VL 32B Instruct53
4Qwen 2.5 VL 32B Instruct52.6
5InternVL3.5-8B51.7
6Qwen 3 VL 8B Instruct47.2
7Lingshu-32B46.9
8MedGemma-4B-IT43.9
9Lingshu-7B41.8
10Qwen 2.5 VL 7B Instruct36.1
11Gemma 3 4B (IT)30.3
12Qwen 3 VL 4B Instruct29.3

Interactive version: theaggregate.ai/benchmark?slug=mmbu-ungrounded-classification · How It Works · Data refreshed daily, snapshot 2026-09-29.