HELM Classic - Synthetic Reasoning Natural — leaderboard

Metric: F1 (%). Source: crfm.stanford.edu. 69 models tracked.

Top models

#ModelScore
1text-davinci-00373.35
2code-davinci-00268.36
3GPT-3.5 Turbo (0301)63.12
4text-davinci-00262.29
5GPT-3.5 Turbo (0613)58.56
6Llama 2 70B47.18
7LLaMA-65B43.24
8Mistral-7B-v0.139.22
9Llama 2 13B27.09
10Llama 2 7B26.02
11mpt-30B22.85
12text-curie-00122.06
13alpaca-7B21.49
14text-babbage-00121.16
15gpt-j-6B19.88

Interactive version: theaggregate.ai/benchmark?slug=helm-classic-synthetic-reasoning-natural · How the rankings work · Data refreshed daily, snapshot 2026-07-22.