Nejumi 4 - Toxicity - Violation Categories: leaderboard
Metric: Criteria met (%). Source: nejumi.ai. 137 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Sonnet 4.5 (Thinking) | 61.9 |
| 2 | Claude Opus 4.1 (Thinking) | 61.11 |
| 3 | gemma-4-E4B-it | 57.94 |
| 4 | GPT-4o (2024-11-20) | 57.94 |
| 5 | Claude Haiku 4.5 (Thinking) | 57.94 |
| 6 | Llama-3.3-Swallow-70B-Instruct-v0.4 | 57.14 |
| 7 | Claude Sonnet 4 (Thinking) | 56.35 |
| 8 | Claude 3.7 Sonnet (Non-reasoning) | 55.56 |
| 9 | Gemma 4 E2B (IT) | 54.76 |
| 10 | Claude 3.7 Sonnet (Thinking) | 54.76 |
| 11 | Claude 3.5 Sonnet | 53.17 |
| 12 | Claude Opus 4.5 (Thinking) | 53.17 |
| 13 | Claude Opus 4.5 (Non-reasoning) | 50.79 |
| 14 | ABEJA-Qwen2.5-32B-Japanese-v1.0 | 50.79 |
| 15 | Qwen 3.6 Max (Preview) (Thinking) | 50.79 |
Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-toxicity-violation-categories · How It Works · Data refreshed daily, snapshot 2026-09-19.