MMLU-by-task - Management — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat84.47
2falcon-180B84.47
3Llama 2 70B Base83.5
4LLaMA-65B82.52
5StableBeluga282.52
6Mistral-7B-v0.181.55
7Llama 2 70B Chat GPTQ81.55
8Llama 2 70B Chat (HF)80.58
9LLaMA-30B77.67
10vicuna-33B-v1.377.67
11falcon-40B Instruct75.73
12Llama 2 13B Chat Base73.79
13vicuna-13B-v1.572.82
14WizardCoder-Python-34B-V1.072.82
15internlm-20B Chat72.82

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-management · How the rankings work · Data refreshed daily, snapshot 2026-07-22.