MMLU-by-task - Philosophy — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Base78.78
2falcon-180B78.78
3Llama 2 70B Chat75.88
4StableBeluga275.56
5LLaMA-65B72.67
6Llama 2 70B Chat GPTQ71.7
7Llama 2 70B Chat (HF)70.42
8Mistral-7B-v0.169.77
9vicuna-33B-v1.368.17
10LLaMA-30B66.56
11MythoMax-L2-13B64.31
12falcon-40B Instruct63.99
13vicuna-13B-v1.563.99
14internlm-20B Chat63.34
15OpenHermes-13B60.77

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-philosophy · How the rankings work · Data refreshed daily, snapshot 2026-07-22.