BehaviorBench - Masked Survey Response: leaderboard

Metric: Accuracy (%) of predicting one masked five-point answer from the other 49 answers, on the Big Five personality survey responses (50 five-point items) of held-out subjects; chance 20; higher is better. Source: arxiv.org. Saturation forecast: Around 2034. 18 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)48.5
2GPT-5.4 (High)47.3
3Claude Sonnet 4.646.7
4GPT-4.146.4
5Gemini 3.1 Flash Lite (Preview)46.3
6Claude Opus 4.645.1
7Claude Haiku 4.544.7
8GPT-5.4 Mini (High)44.3
9Llama 3.3 70B Instruct43.9
10DeepSeek V3.240.6
11Qwen 3 4B37.2

Interactive version: theaggregate.ai/benchmark?slug=behaviorbench-masked-survey-response · How It Works · Data refreshed daily, snapshot 2026-09-29.