CareQA-Vision - Open-Ended: leaderboard

Metric: Judge score (%; 136 open-ended image-based questions from MIR and EIR exams, majority of three LLM judges scoring 0, 0.5 or 1). Source: arxiv.org. Saturation forecast: Around December 2026. 19 models tracked.

Top models

#ModelScore
1GPT-5.274.63
2GLM-4.5V64.71
3Qwen 2 VL 72B Instruct45.59
4Qwen 3 VL 30B A3B Instruct43.75
5HuluMed-7B43.38
6Qwen 3 VL 8B Instruct38.24
7Lingshu-7B31.25
8Qwen 2 VL 7B Instruct26.47

Interactive version: theaggregate.ai/benchmark?slug=careqa-vision-open-ended · How It Works · Data refreshed daily, snapshot 2026-09-25.