Medmarks - Med-HALT Reasoning NOTA: leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Qwen 3 Next 80B A3B (Thinking)78.86
2Grok 478.54
3Gemini 3 Pro (Preview)74.4
4OLMo 3.1 32B (Thinking)72.07
5GPT-5.1 (Medium)69.85
6GPT-5.2 (Medium)69.75
7GLM-4.7 FP869
8Qwen 2.5 32B Instruct68.78
9Qwen 3 235B A22B (Thinking)68.29
10Qwen 3 VL 30B A3B (Thinking)66.97
11OLMo 3 32B (Thinking)63.53
12Ling-flash-2.061.51
13MiniMax-M2.161.08
14GPT-OSS-120B (Medium)60.56
15MiniMax-M259.86

Interactive version: theaggregate.ai/benchmark?slug=medmarks-med-halt-reasoning-nota · How It Works · Data refreshed daily, snapshot 2026-09-05.