CareQA-Vision - MCQ: leaderboard
Metric: Accuracy (%; 165 image-based multiple-choice questions from MIR and EIR exams, exact match). Source: arxiv.org. Saturation forecast: Around December 2026. 19 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5.2 | 80.61 |
| 2 | GLM-4.5V | 72.73 |
| 3 | Qwen 2 VL 72B Instruct | 72.73 |
| 4 | Qwen 3 VL 30B A3B Instruct | 71.52 |
| 5 | HuluMed-7B | 59.39 |
| 6 | Qwen 3 VL 8B Instruct | 58.79 |
| 7 | Lingshu-7B | 56.97 |
| 8 | Qwen 2 VL 7B Instruct | 51.52 |
Interactive version: theaggregate.ai/benchmark?slug=careqa-vision-mcq · How It Works · Data refreshed daily, snapshot 2026-09-25.