ChineseSafe Benchmark — leaderboard

Chinese content safety evaluation: measures LLM accuracy in identifying unsafe vs safe content in Chinese across multiple safety categories.

Metric: Accuracy (%). Source: huggingface.co. Status: saturation imminent. 55 models tracked.

Top models

#ModelScore
1deepseek-llm-67B-chat76.76
2Qwen 3 32B75.26
3Llama 4 Maverick75.02
4Qwen 3 4B74.95
5GPT-4o73.78
6Phi-3-small-8k-instruct72.73
7Phi-472.24
8Qwen 2.5 3B Instruct71.81
9Gemma 1.1 7B (IT)71.7
10GPT-4 Turbo71.67
11deepseek-llm-7B-chat71.63
12Gemma 3 4B (IT)71.41
13Gemini 2.5 Flash (Preview 05-20)71.27
14GLM-4 9B Chat70.96
15Mistral 7B Instruct (v0.3)70.41

Interactive version: theaggregate.ai/benchmark?slug=chinesesafe-benchmark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.