TW-LegalBench - Criminal Law: leaderboard

Metric: Criminal-law questions: accuracy (%) on four-option single-answer questions from Taiwan's 2020-2024 official legal examinations (civil service, judicial, police and professional), zero-shot chain-of-thought, JSON answer (format failures count as wrong), temperature 0 (1 for gpt-5 and gpt-5.2). Source: arxiv.org. Saturation forecast: Around December 2026. 13 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.582.6
2GPT-578.7
3GPT-5.276.2
4Qwen 3 235B A22B75.3
5GPT-4o (2024-08-06)68.6
6Llama 3.1 405B63.9
7GPT-OSS-120B58.5
8nemotron-3-nano-30B-a3B57.2
9Qwen 2.5 7B52.1
10GPT-OSS-20B51.9

Interactive version: theaggregate.ai/benchmark?slug=tw-legalbench-criminal-law · How It Works · Data refreshed daily, snapshot 2026-09-29.