HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Jurisprudence: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.689.81
2Claude Opus 4.789.81
3GPT-5.4 (2026-03-05)88.89
4GPT-4.1 (2025-04-14)85.19
5Qwen 3.5 397B A17B85.19
6Claude Haiku 4.5 (20251001)84.26
7Gemini 2.5 Flash (Thinking)84.26
8Mistral Large 380.56
9Gemma 4 31B (IT)79.63
10Qwen 3 Next 80B A3B Instruct79.63
11Gemini 2.5 Flash Lite (Thinking)79.63
12GPT-4.1 Mini78.7
13Qwen 2.5 72B Instruct76.85
14DeepSeek V3.176.85
15Llama 3.3 70B Instruct75.93

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-jurisprudence · How It Works · Data refreshed daily, snapshot 2026-09-19.