Nejumi 4 - Toxicity - Prohibited Acts: leaderboard

Metric: Criteria met (%). Source: nejumi.ai. 137 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B (Thinking)100
2Qwen 3.5 27B (Thinking)99.48
3Qwen 3.6 Max (Preview) (Thinking)99.48
4GPT-5.2 (xHigh)98.44
5Qwen 3.5 122B A10B (Thinking)98.44
6Claude Opus 4.8 (xHigh)98.44
7Qwen 3.6 27B (Thinking)98.44
8GPT-5.1 (Non-reasoning)97.92
9GPT-5 Nano (High)97.4
10DeepSeek V3.2 (Thinking)97.4
11GPT-5.6 Terra (Max)97.4
12GPT-5.4 (High)97.4
13Claude Opus 4.5 (Non-reasoning)97.4
14GPT-OSS-Swallow-120B-RL-v0.1 (Thinking)97.4
15GPT-5 (High)96.88

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-toxicity-prohibited-acts · How It Works · Data refreshed daily, snapshot 2026-09-19.