SEAL - Professional Reasoning Benchmark - Finance — leaderboard

Metric: Score. Source: scale.com. 29 models tracked.

Top models

#ModelScore
1Muse Spark 1.155.01
2Claude Opus 4.6 (Non-reasoning)53.28
3Muse Spark52.44
4GPT-551.32
5GPT-5 Pro51.06
6O3 Pro49.08
7GPT-5.1 (Thinking)48.01
8O347.69
9Kimi K2.546.51
10GPT-5.2 Pro46.34
11Claude Opus 4.5 (20251101) (Thinking)46.16
12GPT-5.4 (High)45.63
13GPT-OSS-120B43.8
14Claude Sonnet 4.543.79
15Kimi K2 (Thinking)43.41

Interactive version: theaggregate.ai/benchmark?slug=seal-professional-reasoning-benchmark-finance · How the rankings work · Data refreshed daily, snapshot 2026-07-22.