Korean Canonical Legal Benchmark: leaderboard

Korean legal benchmark with multiple-choice and essay-style reasoning tasks, including support for precedent-based answers.

Metric: Mean with supporting precedents (self-reported). Source: benchmarklist.com. Status: saturated. 31 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro82.1
2GPT-578.5
3Gemini 2.5 Flash77.4
4Claude Sonnet 4.576.85
5O376.4
6Claude 3.7 Sonnet72.8
7Claude Opus 4.171.8
8GPT-5 Mini71.15
9Qwen 3 235B A22B (Thinking)70.4
10GPT-4.168.55
11Claude Sonnet 466.75
12O4 Mini64.55
13Kimi K263.65
14DeepSeek V363.45
15DeepSeek R162.75

Interactive version: theaggregate.ai/benchmark?slug=korean-canonical-legal-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-05.