MMLU-by-task - Logical Fallacies — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat81.6
2Llama 2 70B Base80.37
3falcon-180B80.37
4StableBeluga279.75
5Mistral-7B-v0.179.14
6LLaMA-65B77.91
7Llama 2 70B Chat (HF)76.07
8Llama 2 70B Chat GPTQ73.62
9vicuna-33B-v1.371.78
10vicuna-13B-v1.569.33
11internlm-20B Chat68.71
12LLaMA-30B68.1
13MythoMax-L2-13B67.48
14OpenHermes-13B67.48
15trurl-2-13B-academic67.48

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-logical-fallacies · How the rankings work · Data refreshed daily, snapshot 2026-07-22.