MMLU-by-task - Jurisprudence — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1falcon-180B84.26
2Llama 2 70B Base83.33
3Llama 2 70B Chat GPTQ83.33
4Llama 2 70B Chat (HF)82.41
5StableBeluga282.41
6Llama 2 70B Chat79.63
7Mistral-7B-v0.177.78
8LLaMA-65B75.93
9vicuna-13B-v1.574.07
10WizardLM-13B-V1.273.15
11MythoMax-L2-13B72.22
12OpenHermes-13B72.22
13internlm-20B Chat72.22
14LLaMA-30B71.3
15vicuna-33B-v1.371.3

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-jurisprudence · How the rankings work · Data refreshed daily, snapshot 2026-07-22.