HAERAE-Vision - Health/Medical: leaderboard

Metric: Checklist Score (%; original under-specified queries, GPT-5-mini judge, mean of 3 runs). Source: arxiv.org. Saturation forecast: Around December 2026. 45 models tracked.

Top models

#ModelScore
1GPT-562.61
2Gemini 2.5 Pro62.17
3GPT-5 Mini60.45
4Qwen 3 VL 30B A3B (Thinking)56.38
5Qwen 3 VL 32B Instruct56.3
6Gemini 2.5 Flash56.1
7Qwen 3 VL 30B A3B Instruct54.71
8Qwen 3 VL 235B A22B Instruct54.44
9Qwen 3 VL 32B (Thinking)52.39
10Qwen 3 VL 235B A22B (Thinking)52.12
11Qwen 3 VL 8B (Thinking)49.55
12GPT-5 Nano45.98
13Qwen 3 VL 8B Instruct45.65
14Qwen 3 VL 4B (Thinking)45.07
15Gemini 2.5 Flash Lite43.54

Interactive version: theaggregate.ai/benchmark?slug=haerae-vision-health-medical · How It Works · Data refreshed daily, snapshot 2026-09-25.