MMLU-by-task - Formal Logic — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat55.56
2StableBeluga250
3Llama 2 70B Base47.62
4falcon-180B47.62
5LLaMA-65B43.65
6Llama 2 70B Chat (HF)41.27
7Mistral-7B-v0.141.27
8Llama 2 70B Chat GPTQ40.48
9WizardCoder-Python-34B-V1.038.89
10internlm-20B Chat38.89
11vicuna-7B-v1.538.1
12vicuna-13B-v1.337.3
13vicuna-33B-v1.337.3
14vicuna-13B-v1.537.3
15trurl-2-7B36.51

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-formal-logic · How the rankings work · Data refreshed daily, snapshot 2026-07-22.