Avalon-ToM-Bench - Average: leaderboard

Metric: Accuracy (%; macro-average of four abilities, balanced true/false). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro89.67
2GPT-588.5
3Gemini 2.5 Flash86.75
4Qwen 3 4B 2507 (Thinking)80.8
5GPT-5 Mini80.37
6Qwen 3 8B (Thinking)79.51
7Qwen 3 14B (Reasoning)77.25
8GPT-4o Mini75.04
9Qwen 3 4B (Reasoning)74
10Qwen 3.5 9B (Thinking)73.82
11Phi-473.61
12Gemma 3 27B (IT)71.51
13GPT-OSS-120B71.05
14Mistral 7B Instruct (v0.3)70.91
15Llama 3 8B Instruct69.98

Interactive version: theaggregate.ai/benchmark?slug=avalon-tom-bench-average · How It Works · Data refreshed daily, snapshot 2026-09-19.