ForecastBench Baseline - Zero-Shot - Market: leaderboard

Metric: Market Brier Index (difficulty-adjusted, higher is better). Source: www.forecastbench.org. 80 models tracked.

Top models

#ModelScore
1GPT-4.5 (Preview)61.8
2Grok 4.20 0309 (Reasoning)61.7
3Claude Opus 4.1 (20250805)61.7
4Grok Beta61.4
5Claude Sonnet 4.561.3
6GPT-5.561.1
7Grok 4.20 Beta (0309) (Reasoning)61.1
8GLM-560.9
9Grok 4.360.9
10O4 Mini (2025-04-16)60.8
11O3 (2025-04-16)60.7
12Llama 3.3 70B Instruct60.5
13Claude Haiku 4.5 (20251001)60.4
14Claude Sonnet 4 (20250514)60.3
15Llama 3 8B Chat Base60.3

Interactive version: theaggregate.ai/benchmark?slug=forecastbench-baseline-zero-shot-market · How It Works · Data refreshed daily, snapshot 2026-09-19.