MMLU-by-task - Security Studies: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Base79.18
2Llama 2 70B Chat (HF)78.78
3Llama 2 70B Chat76.73
4Mistral-7B-v0.172.65
5LLaMA-65B71.43
6vicuna-33B-v1.368.98
7LLaMA-30B66.94
8Llama 2 13B Chat Base64.08
9trurl-2-7B62.45
10MythoMax-L2-13B62.04
11vicuna-13B-v1.361.63
12vicuna-13B-v1.561.63
13vicuna-13B60.41
14ChatGLM2 6B56.73
15mpt-30B Instruct56.33

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-security-studies · How It Works · Data refreshed daily, snapshot 2026-09-05.