ObGynLongBench - History-Level EHR - L3 Long-Horizon Reasoning: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1Gemini 3 Flash65
2Qwen 3 VL 4B61.3
3GPT-5.4 Mini60.7
4Qwen 3.5 4B (Non-reasoning)59.3
5Lingshu-7B58
6Qwen 3.5 35B A3B (Non-reasoning)57.7
7DeepSeek V4 Flash56
8Phi-4 Mini Instruct53.3
9Claude Haiku 4.552.3
10Qwen 3.5 9B (Non-reasoning)52.3
11Gemma 4 E4B (Non-reasoning)43.3
12MedGemma 1.5 4B29.7

Interactive version: theaggregate.ai/benchmark?slug=obgynlongbench-history-level-ehr-l3-long-horizon-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.