BRIDGE Medical Leaderboard — leaderboard

Clinical practice text understanding leaderboard for medical LLMs, covering summarization, dialogue, clinical evidence, and EHR-oriented tasks across multiple prompting settings.

Metric: Average Performance (%). Source: huggingface.co. Status: saturation imminent. 107 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)49.17
2Gemma 4 26B A4B (IT)47.63
3Gemini 2.5 Flash47.16
4Gemini 1.5 Pro (002)46.63
5Gemini 2.0 Flash (001)46.11
6DeepSeek R145.91
7Qwen 3 Next 80B A3B (Thinking)45.89
8Qwen 3 30B A3B 2507 (Thinking)44.5
9Mistral Large 2 (Nov) Instruct (2411)43.95
10Athene-V2-Chat43.9
11Qwen 2.5 72B Instruct43.82
12Qwen 3 Next 80B A3B Instruct43.62
13Qwen 3 235B A22B (Thinking)43.29
14Qwen 3 30B A3B (Thinking)42.43
15Qwen 2.5 32B Instruct42.36

Interactive version: theaggregate.ai/benchmark?slug=bridge-medical-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.