ContractBench — leaderboard

Metric: SR% (self-reported). Source: benchmarklist.com. 20 models tracked.

Top models

#ModelScore
1Claude Opus 4.677.8
2GPT-5.274.8
3GPT-570.7
4Qwen 3.5 397B A17B70.7
5Claude Sonnet 4.569.7
6Qwen 3.5 27B64.6
7MiniMax-M2.562.6
8MiniMax-M2.160.6
9Qwen 3.5 9B56.6
10MiniMax-M253.5
11Gemini 2.5 Pro51.5
12GPT-5.148.5
13Gemma 4 26B A4B38.4
14Gemma 4 31B37.4
15Ministral 3 14B28.3

Interactive version: theaggregate.ai/benchmark?slug=contractbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.