MMLU-by-task - Moral Scenarios — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1StableBeluga260.78
2falcon-180B53.3
3Llama 2 70B Chat52.51
4LLaMA-65B48.04
5Llama 2 70B Base45.47
6OpenHermes-13B45.14
7MythoMax-L2-13B43.91
8vicuna-33B-v1.343.58
9internlm-20B Chat39.89
10Llama 2 70B Chat (HF)39.55
11LLaMA-30B38.99
12WizardCoder-Python-34B-V1.038.1
13trurl-2-13B-academic37.65
14Llama 2 70B Chat GPTQ32.96
15Mistral-7B-v0.132.51

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-moral-scenarios · How the rankings work · Data refreshed daily, snapshot 2026-07-22.