SEAL - Professional Reasoning Benchmark - Legal — leaderboard

Metric: Score. Source: scale.com. 29 models tracked.

Top models

#ModelScore
1Muse Spark 1.157.05
2Muse Spark52.29
3Claude Opus 4.6 (Non-reasoning)52.27
4GPT-5 Pro49.89
5O3 Pro49.67
6GPT-5.1 (Thinking)49.33
7GPT-548.96
8O348.57
9GPT-5.2 Pro45.44
10GPT-5.4 (High)44.35
11Claude Opus 4.5 (20251101) (Thinking)44.21
12Gemini 3.1 Pro (Preview)44.02
13Kimi K2.543.83
14Gemini 2.5 Pro41.43
15Gemini 2.5 Flash41.02

Interactive version: theaggregate.ai/benchmark?slug=seal-professional-reasoning-benchmark-legal · How the rankings work · Data refreshed daily, snapshot 2026-07-22.