ForecastBench Tournament - Market: leaderboard
Metric: Market Brier Index (difficulty-adjusted, higher is better). Source: www.forecastbench.org. 221 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Grok 4 | 71.2 |
| 2 | Gemini 3 Pro (Preview) | 71.1 |
| 3 | GPT-4.5 (Preview) | 71.1 |
| 4 | Grok Beta | 71.1 |
| 5 | Grok 4 Fast (Reasoning) | 71 |
| 6 | Claude Sonnet 4 (20250514) | 70.9 |
| 7 | Claude Opus 4.5 (20251101) | 70.9 |
| 8 | GPT-5 | 70.7 |
| 9 | Grok 4.1 Fast (Reasoning) | 70.6 |
| 10 | Gemini 3 Flash (Preview) | 70.3 |
| 11 | Claude Opus 4.1 (20250805) | 70.3 |
| 12 | O3 Mini (2025-01-31) | 70.1 |
| 13 | GPT-4 Turbo | 69.9 |
| 14 | Claude 3.7 Sonnet (20250219) | 69.9 |
| 15 | Gemini 2.5 Pro | 69.8 |
Interactive version: theaggregate.ai/benchmark?slug=forecastbench-tournament-market · How It Works · Data refreshed daily, snapshot 2026-09-19.