MMLU-by-task - Logical Fallacies: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1257 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat81.6
2Llama 2 70B Base80.37
3Mistral-7B-v0.179.14
4LLaMA-65B77.91
5Llama 2 70B Chat (HF)76.07
6vicuna-33B-v1.371.78
7vicuna-13B-v1.569.33
8LLaMA-30B68.1
9MythoMax-L2-13B67.48
10Llama 2 13B Chat Base65.03
11vicuna-13B-v1.363.8
12vicuna-13B62.58
13trurl-2-7B55.83
14Llama 2 7B Chat55.21
15vicuna-7B-v1.355.21

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-logical-fallacies · How It Works · Data refreshed daily, snapshot 2026-09-05.