Werewolf Accusation Benchmark - Role Separation: leaderboard

Metric: Belief separation (wolves minus villagers, -3..+3 scale). Source: github.com. Saturation forecast: Around May 2027. 40 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT) (Thinking)1.69
2Qwen 3.6 27B (Thinking)1.64
3Qwen 3.6 27B (Non-reasoning)1.64
4Gemma 4 31B (IT) (Non-reasoning)1.52
5Qwen 3 14B (Reasoning)1.51
6Qwen 3 8B (Thinking)1.51
7Qwen 3.6 35B A3B (Non-reasoning)1.5
8gemma-4-26B-A4B-it (Thinking)1.48
9Qwen 3.5 2B (Thinking)1.48
10Qwen 3.5 4B (Thinking)1.47
11OLMo 3.1 32B (Thinking)1.41
12Phi-41.39
13Qwen 3.5 9B (Thinking)1.37
14Olmo 3.1 32B Instruct1.33
15Qwen 3.6 35B A3B (Reasoning)1.32

Interactive version: theaggregate.ai/benchmark?slug=werewolf-accusation-benchmark-role-separation · How It Works · Data refreshed daily, snapshot 2026-09-25.