Forecast-Dojo (Research Tools): leaderboard

Metric: Multiclass Brier score (0-2 scale, lower is better; mean over 797 scheduled forecast dates of 230 held-out Polymarket events resolved March-June 2026, four rollouts each; unusable forecasts scored as a uniform distribution; date-restricted search over 18.8M CC-News articles, article reading and Python, fresh context at every forecast date). Source: arxiv.org. Saturation forecast: Around 2030. 12 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)0.55
2GPT-5.5 (xHigh)0.56
3GPT-5.4 (xHigh)0.59
4Claude Opus 4.8 (Max)0.59
5Claude Opus 4.6 (Max)0.6
6Qwen 3.5 397B A17B0.64
7MiniMax-M2.50.65
8DeepSeek V3.2 (High)0.66
9GPT-OSS-120B (High)0.7

Interactive version: theaggregate.ai/benchmark?slug=forecast-dojo-research-tools · How It Works · Data refreshed daily, snapshot 2026-09-26.