BoundaryBench (NIST High) — leaderboard

Metric: Success Rate under NIST high policy (%). Source: boundarybench.com. 13 models tracked.

Top models

#ModelScore
1Grok 4.574.9
2GPT-5.6 Sol74.2
3Claude Fable 567.8
4Claude Opus 565.2
5Claude Opus 4.863.3
6GPT-5.6 Terra63.3
7GLM-5.255.8
8Claude Sonnet 555.1
9Kimi K354.7
10GPT-5.6 Luna53.9
11MiniMax-M344.2
12Qwen 3.7 Max40.4

Interactive version: theaggregate.ai/benchmark?slug=boundarybench-nist-high · How It Works · Data refreshed daily, snapshot 2026-08-07.