AgentSocialBench - Information Abstraction: leaderboard

Metric: Information Abstraction Score (0-1; 0, 0.5 or 1 per cross-boundary message for no, partial or full use of an acceptable abstraction) averaged over scenarios, under the L0 (unconstrained) privacy instruction level, judged by Claude Opus 4.6; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 8 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.60.85
2Claude Sonnet 4.50.79
3DeepSeek V3.20.76
4GPT-5 Mini0.75
5Claude Haiku 4.50.75
6Qwen 3 235B A22B0.75
7MiniMax-M2.10.75
8Kimi K2.50.69

Interactive version: theaggregate.ai/benchmark?slug=agentsocialbench-information-abstraction · How It Works · Data refreshed daily, snapshot 2026-10-07.