Avalon-ToM-Bench - Strategic Signaling: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro87.14
2Gemini 2.5 Flash86.33
3GPT-583.57
4Qwen 3 14B (Reasoning)80.71
5Qwen 3 4B 2507 (Thinking)80.58
6Qwen 3 8B (Thinking)77.1
7Qwen 3 4B (Reasoning)76.87
8GPT-5 Mini76.43
9GPT-4o Mini75.71
10Phi-472.86
11Gemma 3 27B (IT)72.14
12Gemma 3 4B (IT)67.86
13Llama 3 8B Instruct67.86
14Qwen 3 1.7B (Thinking)67.39
15Qwen 3.5 9B (Thinking)66.94

Interactive version: theaggregate.ai/benchmark?slug=avalon-tom-bench-strategic-signaling · How It Works · Data refreshed daily, snapshot 2026-09-19.