BehaviorBench - Sequential Survey Response (Distribution): leaderboard

Metric: Wasserstein distance between predicted and observed answer distributions per item (five-point scale, so 0 to 4), averaged over items, predicting each next answer from earlier answers on the Big Five personality survey responses (50 five-point items) of held-out subjects; lower is better. Source: arxiv.org. Saturation forecast: Estimated already saturated. 18 models tracked.

Top models

#ModelScore
1Claude Opus 4.60.43
2Claude Sonnet 4.60.45
3Gemini 3.1 Pro (Preview)0.46
4GPT-5.4 (High)0.46
5GPT-4.10.48
6GPT-5.4 Mini (High)0.49
7Claude Haiku 4.50.52
8Gemini 3.1 Flash Lite (Preview)0.52
9DeepSeek V3.20.54
10Llama 3.3 70B Instruct0.59
11Qwen 3 4B0.65

Interactive version: theaggregate.ai/benchmark?slug=behaviorbench-sequential-survey-response-distribution · How It Works · Data refreshed daily, snapshot 2026-09-29.