Avalon-ToM-Bench - Tacit Coordination: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro92.14
2GPT-591.43
3GPT-5 Mini89.29
4Gemini 2.5 Flash88.41
5Qwen 3 8B (Thinking)87.4
6Qwen 3 4B 2507 (Thinking)84.89
7Qwen 3 14B (Reasoning)83.45
8Phi-480
9Qwen 3.5 9B (Thinking)79.7
10Qwen 3 4B (Reasoning)78.03
11GPT-OSS-120B77.86
12GPT-4o Mini77.86
13Gemma 3 27B (IT)77.14
14Mistral 7B Instruct (v0.3)73.57
15Phi-3.5-mini-instruct72.86

Interactive version: theaggregate.ai/benchmark?slug=avalon-tom-bench-tacit-coordination · How It Works · Data refreshed daily, snapshot 2026-09-19.