LiveSecBench — leaderboard

Dynamic live safety benchmark for large language models across ethics, legality, privacy, factuality, and psychological health.

Metric: Overall Score (%). Source: livesecbench.intokentech.cn. Status: saturation imminent. 43 models tracked.

Top models

#ModelScore
1Claude Haiku 4.591.43
2Claude Sonnet 4.685.97
3GPT-5.284.72
4Qwen 3.5 397B A17B81.52
5Kimi K2.574.79
6Qwen 3 235B A22B69.23
7MiniMax-M266.69
8GPT-OSS-120B66.63
9Seed 2.0 Pro63.04
10MiniMax-M2.561.65
11Gemini 3.1 Pro (Preview)58.16
12MiMo-V2-Flash57.23
13LongCat-Flash-Chat57.1
14GLM-556.73
15DeepSeek V3.256.2

Interactive version: theaggregate.ai/benchmark?slug=livesecbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.