BehaviorBench (Behavioral Traces) - Trade Amount Error (RetrievalGen): leaderboard

Metric: Median absolute error of the predicted trade amount (paper units, unbounded); history interface RetrievalGen (behaviorally similar examples retrieved from a disjoint support pool of wallets); 2,000 pseudonymous prediction-market wallets reconstructed from public Polymarket metadata and Polygon on-chain logs, about 59,560 chronologically held-out test transactions; unparsable outputs count as failures; context-only baseline 31.79; lower is better. Source: arxiv.org. Saturation forecast: Around December 2026. 11 models tracked.

Top models

#ModelScore
1Gemma 3 12B (IT)8.29
2Claude 3.7 Sonnet9.76
3GPT-5.410
4GPT-5.4 Nano10.22
5Llama 4 Scout Instruct10.81
6GPT-5.4 Mini11.13
7NVIDIA-Nemotron-3-Nano-30B-A3B-BF1611.53
8GPT-OSS-20B14.5
9Gemma 3 27B (IT)14.65
10Ministral-3-14B-Instruct-251221.8
11Claude Opus 422.67

Interactive version: theaggregate.ai/benchmark?slug=behaviorbench-behavioral-traces-trade-amount-error-retrievalgen · How It Works · Data refreshed daily, snapshot 2026-09-29.