MMLU-by-task - Jurisprudence: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Base83.33
2Llama 2 70B Chat (HF)82.41
3Llama 2 70B Chat79.63
4Mistral-7B-v0.177.78
5LLaMA-65B75.93
6vicuna-13B-v1.574.07
7MythoMax-L2-13B72.22
8LLaMA-30B71.3
9vicuna-33B-v1.371.3
10Llama 2 13B Chat Base69.44
11vicuna-7B-v1.366.67
12trurl-2-7B64.81
13vicuna-13B-v1.363.89
14vicuna-13B62.04
15Llama 2 7B Chat58.33

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-jurisprudence · How It Works · Data refreshed daily, snapshot 2026-09-05.