MMLU-by-task - Philosophy: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Base78.78
2Llama 2 70B Chat75.88
3LLaMA-65B72.67
4Llama 2 70B Chat (HF)70.42
5Mistral-7B-v0.169.77
6vicuna-33B-v1.368.17
7LLaMA-30B66.56
8MythoMax-L2-13B64.31
9vicuna-13B-v1.563.99
10Llama 2 7B Base60.13
11Llama 2 13B Chat Base58.84
12trurl-2-7B58.52
13vicuna-13B-v1.358.2
14Llama 2 7B Chat56.59
15mpt-30B Instruct56.59

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-philosophy · How It Works · Data refreshed daily, snapshot 2026-09-05.