Medmarks - Med-HALT Reasoning FCT: leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)94.56
2Grok 493.47
3GPT-5.1 (Medium)93.36
4Qwen 3 235B A22B (Thinking)90.07
5GPT-5.2 (Medium)89.98
6Claude Sonnet 4.589.73
7GPT-OSS-120B (Medium)87.96
8GPT-OSS-120B (High)87.67
9Qwen 3 Next 80B A3B (Thinking)86.86
10GPT-OSS-120B (Low)86.7
11GLM-4.7 FP886.17
12OLMo 3.1 32B (Thinking)81.91
13GPT-OSS-20B (High)80.53
14GPT-OSS-20B (Medium)75.74
15MiniMax-M275.6

Interactive version: theaggregate.ai/benchmark?slug=medmarks-med-halt-reasoning-fct · How It Works · Data refreshed daily, snapshot 2026-09-05.