LegalCiteBench: leaderboard

Metric: Overall (Norm.) (self-reported). Source: benchmarklist.com. 21 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.577.8
2Qwen 3 14B71.6
3DeepSeek V3.170.5
4O4 Mini70.1
5Gemini 2.5 Flash69.1
6Llama 3.1 70B64.3
7GPT-5 Mini63.5
8Qwen 3 30B A3B62.8
9Claude Haiku 4.562.4
10Qwen 3 4B59
11Phi-458.5
12Mistral 7B58.5
13Qwen 2.5 7B54.7
14Gemma 3 12B50.7
15GPT-4o Mini50.2

Interactive version: theaggregate.ai/benchmark?slug=legalcitebench · How It Works · Data refreshed daily, snapshot 2026-09-05.