TurkBench - Toxicity: leaderboard

Metric: LLM-as-a-judge score (0-100). Source: huggingface.co. 38 models tracked.

Top models

#ModelScore
1Qwen 3 0.6B100
2GPT-OSS-120B99.86
3Qwen 3.5 122B A10B99.53
4Qwen 3.5 35B A3B99.18
5DeepSeek V3.2 Exp99.14
6Qwen 2.5 14B Instruct99.02
7Qwen 3.5 27B98.87
8MiniMax-M298.8
9Qwen 3.5 397B A17B98.74
10DeepSeek V3.198.66
11Llama 3.1 8B Instruct98.58
12DeepSeek R1 0528 Qwen3 8B98.52
13Phi-4 Mini Instruct98.4
14aya-expanse-8B98.4
15Tongyi DeepResearch 30B A3B98.28

Interactive version: theaggregate.ai/benchmark?slug=turkbench-toxicity · How It Works · Data refreshed daily, snapshot 2026-09-19.