ForecastBench Baseline - Zero-Shot - Overall: leaderboard

Metric: Overall Brier Index (difficulty-adjusted, higher is better). Source: www.forecastbench.org. 80 models tracked.

Top models

#ModelScore
1Grok 4.20 0309 (Reasoning)61.1
2GPT-5.560.9
3Claude Opus 4.1 (20250805)60.9
4O4 Mini (2025-04-16)60.8
5GPT-4.5 (Preview)60.8
6Gemini 2.5 Pro (Preview 03-25)60.7
7Claude Sonnet 4.560.6
8O3 (2025-04-16)60.5
9Grok 4.20 Beta (0309) (Reasoning)60.5
10GLM-560.4
11Grok 4.360.4
12GPT-560.3
13Gemini 3 Pro (Preview)60.3
14Gemini 2.5 Flash (Preview 04-17)60.1
15Grok 4.1 Fast (Reasoning)60

Interactive version: theaggregate.ai/benchmark?slug=forecastbench-baseline-zero-shot-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.