CaseLaw v2 — leaderboard

Private question-answer benchmark over Canadian court-cases.

Metric: Score (self-reported). Source: vals.ai. Status: saturation imminent. 53 models tracked.

Top models

#ModelScore
1Grok 4.3 xAI79.31
2GPT-5.1 highOpenAI73.42
3GPT-4.1 highOpenAI69.88
4GPT-5 Mini highOpenAI68.49
5Claude Opus 4.7 Anthropic68.38
6GPT-5 highOpenAI66.45
7GPT-5.5 x-highOpenAI66.24
8GPT-5.2 x-highOpenAI66.02
9Grok 4 xAI65.81
10Grok 4 Fast xAI65.7

Interactive version: theaggregate.ai/benchmark?slug=caselaw-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.