ForecastBench Baseline - Scratchpad - Dataset: leaderboard

Metric: Dataset Brier Index (difficulty-adjusted, higher is better). Source: www.forecastbench.org. 36 models tracked.

Top models

#ModelScore
1GPT-4.5 (Preview)61.2
2Claude Opus 4 (20250514)60.9
3Gemini 2.5 Flash (Preview 04-17)60.7
4O4 Mini (2025-04-16)60.5
5O3 (2025-04-16)60.4
6GPT-4.160.3
7Claude 3.7 Sonnet (20250219)60.2
8Claude Opus 4.1 (20250805)59.8
9DeepSeek R158.8
10DeepSeek V358.7
11O3 Mini (2025-01-31)58.7
12Claude 3.5 Sonnet (20241022)58.6
13Claude 3.5 Sonnet (20240620)58.6
14Claude Sonnet 4 (20250514)58
15Gemini 1.5 Pro57.7

Interactive version: theaggregate.ai/benchmark?slug=forecastbench-baseline-scratchpad-dataset · How It Works · Data refreshed daily, snapshot 2026-09-19.