InvisibleBench: leaderboard

InvisibleBench evaluates caregiver-support AI systems for relational harms, fail-closed safety and compliance gates, communication quality, coordination, and boundary integrity.

Metric: Hard Fail Rate (self-reported). Source: benchmarklist.com. Status: saturation imminent. 11 models tracked.

Top models

#ModelScore
1GPT-5 Mini0
2MiniMax-M2.51.75
3Claude Sonnet 4.53.51
4Grok 4.1 Fast3.51
5GPT-OSS-120B5.26
6Kimi K2.55.26
7Qwen 3.5 397B A17B5.26
8GLM-55.26
9Gemini 3 Flash8.77
10Gemini 2.5 Flash10.53
11Qwen 3.5 35B A3B10.53

Interactive version: theaggregate.ai/benchmark?slug=invisiblebench · How It Works · Data refreshed daily, snapshot 2026-09-05.