HELM MMLU - Machine Learning: leaderboard

Metric: EM. Source: crfm.stanford.edu. 79 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)83.93
2Gemini 1.5 Pro (002)83.04
3Llama 3.1 405B Instruct79.46
4Claude 3.5 Sonnet (20240620)78.57
5DeepSeek V378.57
6Qwen 2.5 72B Instruct77.68
7GPT-4o (2024-08-06)77.68
8GPT-4o (2024-05-13)76.79
9Qwen 2 72B Instruct76.79
10Gemini 2.0 Flash (Preview)75.89
11GPT-4 (0613)75.89
12GPT-4 Turbo74.11
13Claude 3 Opus (20240229)74.11
14GPT-4 Turbo (Preview)72.32
15Llama 3.3 70B Instruct71.43

Interactive version: theaggregate.ai/benchmark?slug=helm-mmlu-machine-learning · How It Works · Data refreshed daily, snapshot 2026-09-08.