Vals AI Legal Research Bench: leaderboard

Metric: Accuracy (%). Source: www.vals.ai. 57 models tracked.

Top models

#ModelScore
1Claude Opus 555.29
2Claude Fable 5.1 (Max)55.29
3Claude Fable 5 (Max)49.52
4GLM-5.3 (Max)49.04
5GPT-5.6 Sol (Max)48.08
6Grok 4.6 (High)48.08
7Qwen 3.8 Max47.6
8GLM-5.3 Flash (Max)45.19
9Kimi K344.23
10Claude Opus 4.8 (Max)43.75
11Muse Spark 1.2 (xHigh)43.75
12Claude Sonnet 5 (Max)41.83
13GPT-5.6 Terra (Max)41.35
14DeepSeek V4 Pro (0813) (Max)40.87
15GPT-5.5 (xHigh)40.38

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-legal-research-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.