MMBU - Grounded Classification (Masks, Open-Ended): leaderboard

Metric: Open-ended classification of a region marked by a segmentation mask: micro-averaged F1 x100 (0-100) over MMBU's biomedical images from 35 submodalities (95% bootstrap intervals not published); zero-shot, official checkpoints; Qwen3-32B judges strict biomedical equivalence. Source: arxiv.org. Saturation forecast: Around September 2027. 17 models tracked.

Top models

#ModelScore
1Qwen 3 VL 32B Instruct18.2
2GPT-5.4 Mini12.6
3Qwen 2.5 VL 32B Instruct11.5
4InternVL3.5-8B8.8
5Qwen 3 VL 8B Instruct7.4
6GPT-4.1 Mini6.5
7Qwen 3 VL 4B Instruct6.5
8Lingshu-32B5.3
9Lingshu-7B4.9
10MedGemma-4B-IT4.2
11Qwen 2.5 VL 7B Instruct3
12Gemma 3 4B (IT)0.9

Interactive version: theaggregate.ai/benchmark?slug=mmbu-grounded-classification-masks-open-ended · How It Works · Data refreshed daily, snapshot 2026-09-29.