ObGynLongBench - History-Level EHR - L1 Single Evidence: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1DeepSeek V4 Flash66.5
2Gemini 3 Flash66
3Qwen 3.5 4B (Non-reasoning)63.2
4Claude Haiku 4.563
5Qwen 3.5 9B (Non-reasoning)62.7
6GPT-5.4 Mini61.8
7Qwen 3 VL 4B61.8
8Lingshu-7B61
9Qwen 3.5 35B A3B (Non-reasoning)58
10Phi-4 Mini Instruct56.2
11Gemma 4 E4B (Non-reasoning)56
12MedGemma 1.5 4B45.8

Interactive version: theaggregate.ai/benchmark?slug=obgynlongbench-history-level-ehr-l1-single-evidence · How It Works · Data refreshed daily, snapshot 2026-09-19.