MMLU-by-task Leaderboard — leaderboard

MMLU-by-task leaderboard exposing per-subject MMLU performance plus an average score across many open-weight models.

Metric: MMLU Average (%). Source: huggingface.co. Status: saturation imminent. 1257 models tracked.

Top models

#ModelScore
1falcon-180B70.54
2Llama 2 70B Base69.83
3Llama 2 70B Chat69.18
4StableBeluga268.79
5Mistral-7B-v0.164.16
6LLaMA-65B63.93
7Llama 2 70B Chat (HF)63.91
8Llama 2 70B Chat GPTQ62.74
9vicuna-33B-v1.359.22
10internlm-20B Chat58.53
11LLaMA-30B58.47
12vicuna-13B-v1.556.67
13OpenHermes-13B56.35
14falcon-40B Instruct55.45
15MythoMax-L2-13B55.33

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.