HELM Lite - MATH Level 1 - Prealgebra: leaderboard

Metric: Equivalent (CoT) (%). Source: crfm.stanford.edu. 91 models tracked.

Top models

#ModelScore
1Claude 3.5 Haiku (20241022)98.84
2Claude 3.5 Sonnet (20241022)97.67
3GPT-4o (2024-05-13)97.67
4Qwen 2.5 72B Instruct96.51
5Gemini 2.0 Flash (Preview)96.51
6Gemini 1.5 Flash (002)95.35
7Claude 3.5 Sonnet (20240620)95.35
8GPT-4o Mini (2024-07-18)95.35
9GPT-4 Turbo95.35
10Gemini 1.5 Pro (001)95.35
11Llama 3.3 70B Instruct94.19
12Gemini 1.5 Pro (002)94.19
13DeepSeek V394.19
14GPT-4o (2024-08-06)93.02
15Gemma 2 27B (IT)93.02

Interactive version: theaggregate.ai/benchmark?slug=helm-lite-math-level-1-prealgebra · How It Works · Data refreshed daily, snapshot 2026-09-19.