ForecastBench Baseline - Zero-Shot - Dataset: leaderboard

Metric: Dataset Brier Index (difficulty-adjusted, higher is better). Source: www.forecastbench.org. 80 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)61.3
2GPT-561.1
3GPT-5.560.7
4Gemini 3 Pro (Preview)60.7
5O4 Mini (2025-04-16)60.7
6Gemini 3.1 Pro (Preview)60.6
7Gemini 3.5 Flash60.6
8Gemini 2.5 Flash (Preview 04-17)60.5
9Grok 4.20 0309 (Reasoning)60.5
10O3 (2025-04-16)60.4
11Grok 4.1 Fast (Reasoning)60.2
12Grok 4 Fast (Reasoning)60.2
13Gemini 3.1 Pro (Preview) (High)60.2
14Claude Opus 4.1 (20250805)60.2
15Grok 460.1

Interactive version: theaggregate.ai/benchmark?slug=forecastbench-baseline-zero-shot-dataset · How It Works · Data refreshed daily, snapshot 2026-09-19.