BioMedHop (Direct Prompting) - Path-based Reasoning: leaderboard

Metric: Accuracy (%; mean of multiple-choice accuracy and alias-normalised open-answer accuracy on Path-based Reasoning (the hidden disease on a typed five-node SPOKE metapath); stratified evaluation subsets of the 10,045 instances; direct input-output prompting with no retrieved evidence (the paper's IO baseline), temperature 0, at most 1,024 output tokens). Source: arxiv.org. Saturation forecast: Around 2032. 9 models tracked.

Top models

#ModelScore
1GPT-4 Turbo26.1
2Claude 3.7 Sonnet25.5
3Gemini 2.5 Pro25.4
4Qwen 3 Next 80B A3B Instruct23.5
5Claude 3.5 Haiku21.4
6GPT-4o Mini19.8
7MiMo-V2.5-Pro19.5
8Qwen 3 4B16

Interactive version: theaggregate.ai/benchmark?slug=biomedhop-direct-prompting-path-based-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-26.