MMLU-by-task - ARC Challenge — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1StableBeluga265.96
2falcon-180B65.1
3Llama 2 70B Chat64.08
4Llama 2 70B Base62.63
5Llama 2 70B Chat (HF)60.49
6vicuna-33B-v1.359.9
7LLaMA-65B59.39
8falcon-40B Instruct58.28
9MythoMax-L2-13B58.28
10LLaMA-30B58.11
11Llama 2 70B Chat GPTQ58.11
12Mistral-7B-v0.156.83
13OpenHermes-13B56.48
14Llama 2 13B Chat Base55.63
15vicuna-13B-v1.554.95

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-arc-challenge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.