MASK (Scale AI) — leaderboard

The only alignment benchmark measuring how frequently LLMs lie when incentivized. Answers classified as True, Evasive, or Lie - models ranked by 1-p(Lie). Made by the same team behind HLE.

Source: scale.com. Status: saturated.

Interactive version: theaggregate.ai/benchmark?slug=mask-scale-ai · How the rankings work · Data refreshed daily, snapshot 2026-07-22.