PortBench-QA - VaR Estimation: leaderboard

Metric: Item score (%; historical-simulation value at risk from a supplied return series, 50 test questions per model). Source: arxiv.org. Saturation forecast: Around December 2026. 10 models tracked.

Top models

#ModelScore
1Qwen 3.7 Max (Thinking)85.9
2Qwen 3.6 Plus (Thinking)85.8
3GLM-5.1 (Thinking)85.5
4DeepSeek V4 Flash (Thinking)84.3
5DeepSeek V4 Pro (Thinking)83.7
6Qwen 3.6 35B A3B (Thinking)80.8
7Kimi K2.6 (Thinking)42.2

Interactive version: theaggregate.ai/benchmark?slug=portbench-qa-var-estimation · How It Works · Data refreshed daily, snapshot 2026-09-26.