MMLU-by-task - TruthfulQA MC1: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 1253 models tracked.

Top models

#ModelScore
1Llama 2 70B Chat40.27
2vicuna-33B-v1.336.96
3MythoMax-L2-13B36.6
4vicuna-13B-v1.336.47
5vicuna-13B36.11
6Llama 2 70B Chat (HF)35.62
7vicuna-13B-v1.535.62
8vicuna-7B-v1.331.7
9Llama 2 70B Base31.09
10Llama 2 7B Chat30.11
11trurl-2-7B30.11
12ChatGLM2 6B29.99
13CodeLlama-13B-Instruct-hf29.38
14CodeLlama-34B-Instruct-hf29.01
15falcon-7B Instruct28.89

Interactive version: theaggregate.ai/benchmark?slug=mmlu-by-task-truthfulqa-mc1 · How It Works · Data refreshed daily, snapshot 2026-09-05.