MMLU-by-task - Prehistory: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Base83.64
2Llama 2 70B Chat82.72
3LLaMA-65B74.69
4Mistral-7B-v0.173.46
5Llama 2 70B Chat (HF)70.99
6vicuna-33B-v1.368.52
7LLaMA-30B66.98
8vicuna-13B-v1.563.27
9MythoMax-L2-13B62.65
10Llama 2 13B Chat Base61.11
11vicuna-13B-v1.358.33
12mpt-30B Instruct57.72
13Llama 2 7B Chat56.79
14mpt-30B56.48
15vicuna-7B-v1.355.86

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-prehistory · How It Works · Data refreshed daily, snapshot 2026-09-05.