MMLU-by-task - Formal Logic: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat55.56
2Llama 2 70B Base47.62
3LLaMA-65B43.65
4Llama 2 70B Chat (HF)41.27
5Mistral-7B-v0.141.27
6vicuna-13B-v1.337.3
7vicuna-13B-v1.537.3
8vicuna-33B-v1.337.3
9trurl-2-7B36.51
10LLaMA-30B35.71
11vicuna-13B35.71
12ChatGLM2 6B34.92
13mpt-30B Instruct34.92
14CodeLlama-34B-Python-hf34.92
15vicuna-7B-v1.334.13

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-formal-logic · How It Works · Data refreshed daily, snapshot 2026-09-05.