MMLU-by-task - Machine Learning — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat59.82
2falcon-180B56.25
3Llama 2 70B Base53.57
4LLaMA-65B49.11
5Llama 2 70B Chat (HF)48.21
6Mistral-7B-v0.148.21
7Llama 2 70B Chat GPTQ47.32
8StableBeluga246.43
9vicuna-33B-v1.346.43
10mpt-30B45.54
11vicuna-7B-v1.544.64
12vicuna-13B-v1.544.64
13ChatGLM2 6B43.75
14vicuna-13B-v1.343.75
15Baichuan-7B41.96

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-machine-learning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.