PLawBench: leaderboard

Rubric-based benchmark for real-world legal practice: 850 questions across 13 practical legal scenarios, each scored against expert-written rubrics.

Metric: Overall (self-reported). Source: benchmarklist.com. Status: years away from saturation. 29 models tracked.

Top models

#ModelScore
1Qwen 3.8 Max73.2
2GPT-5.6 Sol (Max)72.3
3Claude Fable 570.2
4GPT-5.269.67
5Claude Opus 4.869.6
6GPT-567.76
7Claude Opus 4.566.47
8Gemini 3 Pro (Preview)66.35
9Claude Sonnet 4.565.88
10Qwen 3 Max64.75
11Gemini 2.5 Pro64.05
12Qwen 3 235B A22B 2507 Instruct63.08
13Gemini 2.5 Flash62.07
14GLM-4.660.49
15Qwen 3.7 Max58.9

Interactive version: theaggregate.ai/benchmark?slug=plawbench · How It Works · Data refreshed daily, snapshot 2026-09-05.