TRLawBench — leaderboard

Turkish legal benchmark testing legal knowledge, reasoning, and open-ended analysis over Turkish law tasks.

Metric: Stage 1 accuracy (self-reported). Source: benchmarklist.com. Status: saturation imminent. 32 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash85
2O4 Mini84.4
3Gemini 2.5 Pro83.8
4O381.3
5GPT-4.180
6Claude 3.7 Sonnet79.4
7GPT-4.1 Mini76.3
8Claude Sonnet 475.6
9Claude 3.7 Sonnet (Thinking)75.6
10GPT-4o75
11Claude 3.5 Sonnet74.4
12Qwen 3 235B A22B72.5
13Mistral Large71.3
14Gemma 3 27B70
15Llama 3.3 70B Instruct69.4

Interactive version: theaggregate.ai/benchmark?slug=trlawbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.