Avalon-ToM-Bench - Perspective-Taking: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1GPT-582.35
2Gemini 2.5 Pro79.41
3Gemini 2.5 Flash77.27
4Qwen 3 4B 2507 (Thinking)72.73
5Mistral 7B Instruct (v0.3)69.12
6GPT-5 Mini69.12
7Llama 3.2 3B Instruct68.89
8Qwen 3.5 9B (Thinking)68.63
9Qwen 3 8B (Thinking)68.42
10Gemma 3 4B (IT)67.65
11GPT-OSS-120B63.24
12GPT-4o Mini63.24
13Llama 3 8B Instruct63.24
14Phi-463.24
15Gemma 3 27B (IT)61.76

Interactive version: theaggregate.ai/benchmark?slug=avalon-tom-bench-perspective-taking · How It Works · Data refreshed daily, snapshot 2026-09-19.