HELM EWoK - Quantitative Properties: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 15 models tracked.

Top models

#ModelScore
1Qwen 2 72B Instruct100
2Claude 3 Opus (20240229)100
3Claude 3.5 Sonnet (20240620)99.47
4GPT-4 Turbo98.68
5Claude 3 Sonnet (20240229)98.42
6Llama 3 70B Instruct98.16
7GPT-4o (2024-05-13)98.16
8GPT-4o Mini (2024-07-18)97.63
9Claude 3 Haiku (20240307)96.84
10Mistral 7B Instruct (v0.3)91.32
11GPT-3.5 Turbo (0125)90.79
12Claude 3.5 Haiku (20241022)90.53
13Llama 3 8B Instruct17.63

Interactive version: theaggregate.ai/benchmark?slug=helm-ewok-quantitative-properties · How It Works · Data refreshed daily, snapshot 2026-09-19.