Medmarks - MedHallu Easy — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)86.5
2Claude Sonnet 4.583.83
3GPT-5.1 (Medium)80.07
4Ling-flash-2.076.47
5Llama 3.3 70B Instruct74.31
6GPT-OSS-120B (High)73.45
7GLM-4.7 FP872.23
8INTELLECT-370.67
9Grok 470.41
10Qwen 3 235B A22B (Thinking)69.89
11GPT-OSS-20B (Medium)69.26
12Hermes 4 70B69.19
13GPT-OSS-20B (High)67.96
14Qwen 3 4B (Reasoning)67.89
15GPT-OSS-120B (Medium)67.86

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medhallu-easy · How the rankings work · Data refreshed daily, snapshot 2026-07-22.