MMLU-by-task - Moral Disputes: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Base77.75
2Llama 2 70B Chat75.72
3LLaMA-65B73.7
4Llama 2 70B Chat (HF)71.68
5Mistral-7B-v0.171.1
6vicuna-33B-v1.368.5
7LLaMA-30B67.05
8MythoMax-L2-13B62.43
9Llama 2 13B Chat Base61.27
10vicuna-13B-v1.560.4
11vicuna-13B-v1.358.96
12vicuna-13B56.36
13Phi-1.554.91
14trurl-2-7B53.18
15ChatGLM2 6B52.89

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-moral-disputes · How It Works · Data refreshed daily, snapshot 2026-09-05.