HuluMed-7B: benchmark results

Provider: Other.

Unified ELO 1528 ± 29, rank #624 of 1537 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CareQA-Vision - Open-Ended - Medicine48.61Judge score (%; 108 open-ended image-based questions from MI64.7
CareQA-Vision - Open-Ended43.38Judge score (%; 136 open-ended image-based questions from MI61.1
CareQA-Vision - MCQ - Medicine65.85Accuracy (%; 123 image-based multiple-choice questions from 52.9
MedPIC-Bench - Rule Deactivation38.2Accuracy (%)51.9
CareQA-Vision - Open-Ended - Nursing23.21Judge score (%; 28 open-ended image-based questions from EIR50
CareQA-Vision - MCQ59.39Accuracy (%; 165 image-based multiple-choice questions from 47.2
MedPIC-Bench - Counterfactual Pair14.6Both-correct pair rate (%)38.9
BRIDGE Medical Leaderboard - Few-Shot40.6Average Performance (%)37
BRIDGE Medical Leaderboard32.97Average Performance (%)33.3
BRIDGE Medical Leaderboard - Zero-Shot30.71Average Performance (%)33.3
BRIDGE Medical Leaderboard - CoT27.6Average Performance (%)31.5
CardioLens44.81F1 (Random) (self-reported)30.4

Interactive version: theaggregate.ai/model?slug=hulumed-7b · How It Works · Data refreshed daily, snapshot 2026-09-25.