Werewolf Accusation Benchmark - Role Separation: leaderboard
Metric: Belief separation (wolves minus villagers, -3..+3 scale). Source: github.com. Saturation forecast: Around May 2027. 40 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemma 4 31B (IT) (Thinking) | 1.69 |
| 2 | Qwen 3.6 27B (Thinking) | 1.64 |
| 3 | Qwen 3.6 27B (Non-reasoning) | 1.64 |
| 4 | Gemma 4 31B (IT) (Non-reasoning) | 1.52 |
| 5 | Qwen 3 14B (Reasoning) | 1.51 |
| 6 | Qwen 3 8B (Thinking) | 1.51 |
| 7 | Qwen 3.6 35B A3B (Non-reasoning) | 1.5 |
| 8 | gemma-4-26B-A4B-it (Thinking) | 1.48 |
| 9 | Qwen 3.5 2B (Thinking) | 1.48 |
| 10 | Qwen 3.5 4B (Thinking) | 1.47 |
| 11 | OLMo 3.1 32B (Thinking) | 1.41 |
| 12 | Phi-4 | 1.39 |
| 13 | Qwen 3.5 9B (Thinking) | 1.37 |
| 14 | Olmo 3.1 32B Instruct | 1.33 |
| 15 | Qwen 3.6 35B A3B (Reasoning) | 1.32 |
Interactive version: theaggregate.ai/benchmark?slug=werewolf-accusation-benchmark-role-separation · How It Works · Data refreshed daily, snapshot 2026-09-25.