LegalCiteBench — leaderboard

Metric: Overall (Norm.) (self-reported). Source: benchmarklist.com. 21 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.577.8
2Qwen 3 14B71.6
3DeepSeek V3.170.5
4O4 Mini70.1
5Gemini 2.5 Flash69.1
6Llama 3.1 70B64.3
7GPT-5 Mini63.5
8Qwen 3 30B A3B62.8
9Claude Haiku 4.562.4
10Phi-458.5
11Mistral 7B58.5
12Qwen 2.5 7B54.7
13Gemma 3 12B50.7
14GPT-4o Mini50.2
15Llama 3.1 8B49.8

Interactive version: theaggregate.ai/benchmark?slug=legalcitebench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.