Foresight Bench: leaderboard

Metric: Forecast Skill (100 - Brier x 100). Source: benchmark.aleatoricai.com. 13 models tracked.

Top models

#ModelScore
1Claude Opus 4.893.75
2Claude Opus 4.792.6
3Claude Fable 592.37
4Claude Opus 4.692.35
5Kimi K2.691.59
6GPT-5.591.41
7Gemini 3.1 Pro (Preview)90.23
8Gemini 3.5 Flash89.78
9Grok 4.388.36
10Qwen 3 235B A22B87.71
11Kimi K2 (Thinking)87.57
12GPT-OSS-120B83.76

Interactive version: theaggregate.ai/benchmark?slug=foresight-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.