Korean Canonical Legal Benchmark — leaderboard

Korean legal benchmark with multiple-choice and essay-style reasoning tasks, including support for precedent-based answers.

Metric: Mean with supporting precedents (self-reported). Source: benchmarklist.com. Status: saturated. 31 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro82.1
2GPT-578.5
3Gemini 2.5 Flash77.4
4Claude Sonnet 4.576.85
5O376.4
6Claude 3.7 Sonnet72.8
7Claude Opus 4.171.8
8GPT-5 Mini71.15
9GPT-4.168.55
10Claude Sonnet 466.75
11O4 Mini64.55
12DeepSeek V363.45
13Claude 3.5 Sonnet60.55
14Qwen 3 32B60.4
15GPT-OSS-120B60.05

Interactive version: theaggregate.ai/benchmark?slug=korean-canonical-legal-benchmark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.