EPAG - HPI Guideline Score: leaderboard

Metric: Guideline-Matched History Units per Dialogue (unweighted). Source: arxiv.org. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1GPT-4.14.82
2Claude 3.5 Sonnet4.62
3Claude 3.7 Sonnet4.59
4Claude 3.5 Haiku4.58
5GPT-4.1 Mini4.46
6GPT-4o Mini4.46
7GPT-4o4.39
8Phi-3.5-mini-instruct3.91

Interactive version: theaggregate.ai/benchmark?slug=epag-hpi-guideline-score · How It Works · Data refreshed daily, snapshot 2026-09-25.