Foresight Bench — leaderboard

Metric: Forecast Skill (100 - Brier x 100). Source: benchmark.aleatoricai.com. 13 models tracked.

Top models

#ModelScore
1Claude Opus 4.891.93
2Kimi K2.691.59
3Claude Opus 4.790.51
4Claude Opus 4.690.08
5Claude Fable 589.75
6GPT-5.589.57
7Gemini 3.5 Flash89.19
8Gemini 3.1 Pro (Preview)87.75
9Kimi K2 (Thinking)87.53
10Grok 4.385.55
11Qwen 3 235B A22B85.22
12GPT-OSS-120B82.65

Interactive version: theaggregate.ai/benchmark?slug=foresight-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.