Avalon-ToM-Bench - Intention Attribution: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro100
2GPT-596.67
3Gemini 2.5 Flash95
4GPT-5 Mini86.67
5Qwen 3 4B (Reasoning)86.27
6Qwen 3 8B (Thinking)85.11
7Qwen 3 4B 2507 (Thinking)85
8GPT-4o Mini83.33
9Qwen 3 14B (Reasoning)83.05
10GPT-OSS-120B81.67
11Llama 3 8B Instruct81.67
12Qwen 3.5 9B (Thinking)80
13Llama 3.2 3B Instruct78.43
14Phi-478.33
15Phi-3.5-mini-instruct78.33

Interactive version: theaggregate.ai/benchmark?slug=avalon-tom-bench-intention-attribution · How It Works · Data refreshed daily, snapshot 2026-09-19.