CAIS Risk Index: leaderboard

Composite CAIS AI Dashboard risk index averaging VCT refusal risk, HLE miscalibration, MASK risk, Machiavelli, and TextQuests Harm for models with all component scores. Lower is better.

Metric: Risk Index (self-reported). Source: benchmarklist.com. 48 models tracked.

Top models

#ModelScore
1Claude Fable 527.3
2Muse Spark 1.134.2
3Claude Opus 4.739
4Claude Sonnet 4.539.6
5Claude Opus 4.839.6
6GLM-5.242.4
7Claude Opus 4.542.7
8Claude Opus 544
9Grok 4.2044.5
10Claude Sonnet 4.644.6
11Grok 4.344.7
12Claude Opus 4.646.7
13GPT-5.547.8
14GPT-5.248.9
15GPT-5.6 Terra49.9

Interactive version: theaggregate.ai/benchmark?slug=cais-risk-index · How It Works · Data refreshed daily, snapshot 2026-09-05.