MASK (Scale AI) — leaderboard
The only alignment benchmark measuring how frequently LLMs lie when incentivized. Answers classified as True, Evasive, or Lie - models ranked by 1-p(Lie). Made by the same team behind HLE.
Source: scale.com. Status: saturated.
Interactive version: theaggregate.ai/benchmark?slug=mask-scale-ai · How the rankings work · Data refreshed daily, snapshot 2026-07-22.