HELM Lite - LegalBench - PROA: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 91 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Instruct100
2Mistral Large 2 (Jul)100
3Gemini 1.5 Pro (001)100
4Claude 3.5 Sonnet (20241022)98.95
5GPT-4o (2024-05-13)98.95
6Gemini 2.0 Flash (Preview)98.95
7Claude 3 Opus (20240229)98.95
8Llama 3.2 90B Vision Instruct98.95
9GPT-4 Turbo (Preview)98.95
10Jamba 1.5 Large98.95
11Llama 3.3 70B Instruct97.89
12Qwen 2.5 72B Instruct97.89
13Gemini 1.5 Flash (002)97.89
14GPT-4o (2024-08-06)97.89
15Gemma 2 27B (IT)97.89

Interactive version: theaggregate.ai/benchmark?slug=helm-lite-legalbench-proa · How It Works · Data refreshed daily, snapshot 2026-09-19.