ObGynLongBench - History-Level EHR - L2 Multi-Source Integration: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1Gemini 3 Flash71.5
2GPT-5.4 Mini68
3DeepSeek V4 Flash66.5
4Qwen 3.5 35B A3B (Non-reasoning)62.1
5Claude Haiku 4.561
6Qwen 3.5 9B (Non-reasoning)60.1
7Lingshu-7B59.5
8Qwen 3 VL 4B58.2
9Qwen 3.5 4B (Non-reasoning)57.5
10Gemma 4 E4B (Non-reasoning)53.2
11Phi-4 Mini Instruct47.8
12MedGemma 1.5 4B43.5

Interactive version: theaggregate.ai/benchmark?slug=obgynlongbench-history-level-ehr-l2-multi-source-integration · How It Works · Data refreshed daily, snapshot 2026-09-19.