MedQ-Deg - Intensity Degradation: leaderboard

Metric: Accuracy (%) on MedQ-Deg items whose images carry intensity-jitter degradations, pooled over the L1 (mild) and L2 (severe) severities, multiple-choice medical VQA items merged from OmniMedVQA, GMAI-MMBench and MedXpertQA, each image corrupted by modality-specific degradations whose severity three radiologists calibrated (24,894 QA pairs over 7 modalities and 18 degradation types), single-letter answer, temperature 1.0, mean of 3 runs; higher is better. Source: arxiv.org. Saturation forecast: Around February 2027. 40 models tracked.

Top models

#ModelScoreOverall rank
1Qwen 3 VL 30B A3B Instruct76.2#365
2Qwen 3 VL 235B A22B Instruct75.3#264
3GPT-572.2#91
4Gemini 2.5 Pro71.1#145
5GPT-5.170.9#131
6GPT-4.169.4#240
7GPT-4o68.8#333
8Gemini 2.5 Flash67.5#237
9GPT-4.1 Mini67.1#346
10MedGemma-4B66#731
11GLM-4.5V65.5#339
12GPT-4o Mini62.3#588
13Claude Sonnet 4.559.1#138
14Gemma 3 27B58.2#596
15Qwen 2.5 VL 72B Instruct57.6#364

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=medq-deg-intensity-degradation · How It Works · Data refreshed daily, snapshot 2026-10-11.