MMLU-by-task - Prehistory — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Base83.64
2Llama 2 70B Chat82.72
3falcon-180B81.17
4StableBeluga279.63
5LLaMA-65B74.69
6Mistral-7B-v0.173.46
7Llama 2 70B Chat (HF)70.99
8Llama 2 70B Chat GPTQ70.37
9vicuna-33B-v1.368.52
10LLaMA-30B66.98
11OpenHermes-13B64.2
12vicuna-13B-v1.563.27
13MythoMax-L2-13B62.65
14falcon-40B Instruct62.04
15internlm-20B Chat61.73

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-prehistory · How the rankings work · Data refreshed daily, snapshot 2026-07-22.