MedRedFlag - False Assumptions Addressed: leaderboard

Metric: Share of 100 questions (%) whose response explicitly addresses or corrects at least one embedded false assumption (GPT-5 judge). Source: arxiv.org. Saturation forecast: Around December 2026. 5 models tracked.

Top models

#ModelScore
1GPT-588
2Claude Opus 4.578
3Qwen 3 32B72
4MedGemma-27B-IT71
5Llama 3.3 70B Instruct50

Interactive version: theaggregate.ai/benchmark?slug=medredflag-false-assumptions-addressed · How It Works · Data refreshed daily, snapshot 2026-09-25.