MMLU-by-task - ARC Challenge: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat64.08
2Llama 2 70B Base62.63
3Llama 2 70B Chat (HF)60.49
4vicuna-33B-v1.359.9
5LLaMA-65B59.39
6MythoMax-L2-13B58.28
7LLaMA-30B58.11
8Mistral-7B-v0.156.83
9Llama 2 13B Chat Base55.63
10vicuna-13B-v1.554.95
11mpt-30B Instruct54.27
12LLaMA-13B53.16
13vicuna-13B-v1.353.16
14mpt-30B52.9
15Phi-1.550.34

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-arc-challenge · How It Works · Data refreshed daily, snapshot 2026-09-05.