BehaviorBench - Masked Survey Response (Distribution): leaderboard

Metric: Wasserstein distance between predicted and observed answer distributions per item (five-point scale, so 0 to 4), averaged over items, predicting a masked answer from the other 49 on the Big Five personality survey responses (50 five-point items) of held-out subjects; lower is better. Source: arxiv.org. Saturation forecast: Estimated already saturated. 18 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)0.36
2Claude Sonnet 4.60.36
3Claude Opus 4.60.37
4GPT-4.10.38
5GPT-5.4 (High)0.38
6Gemini 3.1 Flash Lite (Preview)0.41
7Claude Haiku 4.50.43
8GPT-5.4 Mini (High)0.46
9Llama 3.3 70B Instruct0.47
10DeepSeek V3.20.47
11Qwen 3 4B0.66

Interactive version: theaggregate.ai/benchmark?slug=behaviorbench-masked-survey-response-distribution · How It Works · Data refreshed daily, snapshot 2026-09-29.