MMLU-by-task - Moral Scenarios: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat52.51
2LLaMA-65B48.04
3Llama 2 70B Base45.47
4MythoMax-L2-13B43.91
5vicuna-33B-v1.343.58
6Llama 2 70B Chat (HF)39.55
7LLaMA-30B38.99
8Mistral-7B-v0.132.51
9Llama 2 13B Chat Base30.5
10mpt-30B Instruct30.28
11LLaMA-13B29.83
12vicuna-13B-v1.528.83
13codegen-16B-nl28.27
14vicuna-13B-v1.327.6
15opt-30B27.6

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-moral-scenarios · How It Works · Data refreshed daily, snapshot 2026-09-05.