Nejumi 4 - Toxicity - Fairness: leaderboard

Metric: Criteria met (%). Source: nejumi.ai. 137 models tracked.

Top models

#ModelScore
1Claude Haiku 4.5 (Thinking)100
2GLM-5.3 (Max)100
3Claude Opus 5 (Max)100
4Claude Opus 4.6 (Thinking)100
5Claude Opus 4.5 (Non-reasoning)100
6Qwen 3.5 27B (Thinking)99.44
7Claude Sonnet 4.6 (Thinking)99.44
8K-EXAONE-236B-A23B (Thinking)99.44
9Claude Opus 4.8 (xHigh)99.44
10Qwen 3.6 Max (Preview) (Thinking)99.44
11Kimi K3 (Thinking)99.44
12MiniMax M3 (Thinking)99.44
13MiMo V2.5 Pro (Thinking)99.44
14Claude Sonnet 4.5 (Thinking)98.87
15Kimi K3 (Max)98.87

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-toxicity-fairness · How It Works · Data refreshed daily, snapshot 2026-09-19.