BRIDGE Medical Leaderboard: leaderboard

Clinical practice text understanding leaderboard for medical LLMs, covering summarization, dialogue, clinical evidence, and EHR-oriented tasks across multiple prompting settings.

Metric: Average Performance (%). Source: huggingface.co. Status: years away from saturation. 109 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)49.17
2Qwen 3.8 27B (Non-reasoning)47.74
3Gemma 4 26B A4B (IT)47.63
4Gemini 2.5 Flash47.16
5Gemini 1.5 Pro (002)46.63
6Gemini 2.0 Flash (001)46.11
7DeepSeek R145.91
8Qwen 3 Next 80B A3B (Thinking)45.89
9GPT-4o (2024-08-06)45.82
10Qwen 3 30B A3B 2507 (Thinking)44.5
11Mistral Large 2 (Nov) Instruct (2411)43.95
12Athene-V2-Chat43.9
13Qwen 2.5 72B Instruct43.82
14Qwen 3 Next 80B A3B Instruct43.62
15Qwen 3 235B A22B (Thinking)43.29

Interactive version: theaggregate.ai/benchmark?slug=bridge-medical-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.