EPAG - Weighted HPI Guideline Score: leaderboard

Metric: Guideline-Matched History Units per Dialogue (high=2, medium=1). Source: arxiv.org. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1GPT-4.18.12
2Claude 3.7 Sonnet8.12
3Claude 3.5 Sonnet8.05
4Claude 3.5 Haiku7.84
5GPT-4o Mini7.75
6GPT-4.1 Mini7.64
7GPT-4o7.59
8Phi-3.5-mini-instruct6.88

Interactive version: theaggregate.ai/benchmark?slug=epag-weighted-hpi-guideline-score · How It Works · Data refreshed daily, snapshot 2026-09-25.