PRBench Finance: leaderboard

Professional Reasoning Bench Finance evaluates frontier LLMs on complex financial reasoning tasks including analysis, modeling, and decision-making.

Metric: Score. Source: scale.com. Status: years away from saturation. 32 models tracked.

Top models

#ModelScore
1Muse Spark 1.155.01
2Claude Fable 553.86
3Claude Opus 4.6 (Non-reasoning)53.28
4Muse Spark52.44
5GPT-551.32
6GPT-5 Pro51.06
7Claude Fable 5.1 (xHigh)50.8
8GPT-5.6 Sol (Max)50.45
9O3 Pro49.08
10GPT-5.1 (Thinking)48.01
11O347.69
12Kimi K2.546.51
13GPT-5.2 Pro46.34
14Claude Opus 4.5 (20251101) (Thinking)46.16
15GPT-5.4 (High)45.63

Interactive version: theaggregate.ai/benchmark?slug=prbench-finance · How It Works · Data refreshed daily, snapshot 2026-09-05.