HELM MMLU - Jurisprudence: leaderboard

Metric: EM. Source: crfm.stanford.edu. 79 models tracked.

Top models

#ModelScore
1GPT-4o (2024-08-06)90.74
2Claude 3.5 Sonnet (20241022)89.81
3Gemini 1.5 Pro (002)89.81
4Gemini 2.0 Flash (Preview)89.81
5DeepSeek V389.81
6GPT-4o (2024-05-13)89.81
7Yi 34B (Base)89.81
8Llama 3.1 70B Instruct88.89
9Claude 3.5 Sonnet (20240620)88.89
10Gemini 1.5 Pro (001)88.89
11Gemini 1.5 Flash (001)88.89
12GPT-4 (0613)88.89
13GPT-4 Turbo (Preview)88.89
14Llama 3.2 90B Vision Instruct87.96
15GPT-4 Turbo87.96

Interactive version: theaggregate.ai/benchmark?slug=helm-mmlu-jurisprudence · How It Works · Data refreshed daily, snapshot 2026-09-08.