BoundaryBench (NIST High): leaderboard

Metric: Success Rate under NIST high policy (%). Source: boundarybench.com. 14 models tracked.

Top models

#ModelScore
1Grok 4.574.9
2GPT-5.6 Sol74.2
3Claude Fable 567.8
4Gemini 3.7 Flash66.7
5Claude Opus 565.2
6Claude Opus 4.863.3
7GPT-5.6 Terra63.3
8Muse Spark 1.260.7
9GLM-5.255.8
10Claude Sonnet 555.1
11Kimi K354.7
12GPT-5.6 Luna53.9
13MiniMax-M344.2
14Qwen 3.7 Max40.4

Interactive version: theaggregate.ai/benchmark?slug=boundarybench-nist-high · How It Works · Data refreshed daily, snapshot 2026-09-21.