MMLU-by-task Leaderboard: leaderboard

MMLU-by-task leaderboard exposing per-subject MMLU performance plus an average score across many open-weight models.

Metric: MMLU Average (%). Source: huggingface.co. Status: saturated. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Base69.83
2Llama 2 70B Chat69.18
3Mistral-7B-v0.164.16
4LLaMA-65B63.93
5Llama 2 70B Chat (HF)63.91
6vicuna-33B-v1.359.22
7LLaMA-30B58.47
8vicuna-13B-v1.556.67
9MythoMax-L2-13B55.33
10Llama 2 13B Chat Base54.64
11vicuna-13B-v1.352.88
12vicuna-13B50.84
13trurl-2-7B50
14mpt-30B Instruct49.15
15Llama 2 7B Chat48.32

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.