Vals AI CaseLaw v2: leaderboard

Metric: Accuracy (%). Source: www.vals.ai. 54 models tracked.

Top models

#ModelScore
1Grok 4.379.31
2GPT-5.1 (High)73.42
3GPT-4.169.88
4GPT-5 Mini (High)68.49
5Claude Opus 4.768.38
6GPT-5 (High)66.45
7GPT-5.5 (xHigh)66.24
8GPT-5.2 (xHigh)66.02
9Grok 465.81
10Kimi K2 (Thinking)65.7
11Grok 4 Fast (Reasoning)65.7
12Gemini 3.1 Pro (Preview) (High)64.84
13Command A64.52
14Claude Sonnet 4.663.99
15Gemini 2.5 Pro63.88

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-caselaw-v2 · How It Works · Data refreshed daily, snapshot 2026-09-05.