MMLU-by-task - Econometrics — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Mistral-7B-v0.150
2StableBeluga246.49
3Llama 2 70B Base44.74
4Llama 2 70B Chat44.74
5falcon-180B43.86
6Llama 2 70B Chat (HF)41.23
7vicuna-7B-v1.5-16k39.47
8Llama 2 7B Chat37.72
9LLaMA-65B37.72
10Llama 2 70B Chat GPTQ36.84
11LLaMA-30B35.96
12vicuna-33B-v1.335.09
13trurl-2-7B33.33
14CodeLlama-7B-Instruct-hf32.46
15vicuna-13B-v1.532.46

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-econometrics · How the rankings work · Data refreshed daily, snapshot 2026-07-22.