HELM Lite - MATH Level 1: leaderboard

Metric: Equivalent (CoT) (%). Source: crfm.stanford.edu. 91 models tracked.

Top models

#ModelScore
1Gemini 1.5 Pro (002)91.99
2DeepSeek V391.21
3Gemini 1.5 Flash (002)90.77
4Claude 3.5 Sonnet (20241022)90.37
5Gemini 2.0 Flash (Preview)90.13
6Qwen 2.5 72B Instruct88.39
7Claude 3.5 Haiku (20241022)87.17
8GPT-4 Turbo (Preview)85.69
9GPT-4o (2024-08-06)85.25
10GPT-4 Turbo83.29
11GPT-4o (2024-05-13)82.89
12Llama 3.1 405B Instruct82.7
13Gemini 1.5 Pro (001)82.47
14Nova Pro82.14
15Claude 3.5 Sonnet (20240620)81.28

Interactive version: theaggregate.ai/benchmark?slug=helm-lite-math-level-1 · How It Works · Data refreshed daily, snapshot 2026-09-19.