MMLU-by-task - TruthfulQA MC1 — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1253 models tracked.

Top models

#ModelScore
1StableBeluga242.59
2Llama 2 70B Chat40.27
3falcon-40B Instruct37.7
4vicuna-33B-v1.336.96
5MythoMax-L2-13B36.6
6vicuna-13B-v1.336.47
7vicuna-13B36.11
8Llama 2 70B Chat (HF)35.62
9vicuna-13B-v1.535.62
10Llama 2 70B Chat GPTQ34.64
11vicuna-7B-v1.5-16k33.41
12Nous-Hermes-llama-2-7B33.41
13vicuna-7B-v1.533.17
14WizardCoder-Python-34B-V1.032.8
15WizardLM-13B-V1.232.56

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-truthfulqa-mc1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.