InvisibleBench — leaderboard

InvisibleBench evaluates caregiver-support AI systems for relational harms, fail-closed safety and compliance gates, communication quality, coordination, and boundary integrity.

Metric: Hard Fail Rate (self-reported). Source: benchmarklist.com. Status: saturation imminent. 11 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash10.5
2Qwen 3.5 35B A3B10.5
3Gemini 3 Flash (Preview)8.8
4GPT-OSS-120B5.3
5GLM-55.3
6Qwen 3.5 397B A17B5.3
7Claude Sonnet 4.53.5
8Grok 4.1 Fast3.5
9MiniMax-M2.51.8
10GPT-5 Mini0

Interactive version: theaggregate.ai/benchmark?slug=invisiblebench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.