HELM NaturalQuestions (Open): leaderboard

Open-book question answering from Google search queries with access to Wikipedia passages, scored by F1. Part of Stanford HELM.

Metric: F1 (%). Source: crfm.stanford.edu. Status: saturated. 91 models tracked.

Top models

#ModelScore
1Nova Pro82.9
2Nova Lite81.52
3PaLM-2 (Bison)81.26
4GPT-4o (2024-05-13)80.32
5GPT-4 Turbo79.52
6GPT-4o (2024-08-06)79.26
7GPT-4 (0613)78.97
8Nova Micro77.86
9Qwen 1.5 32B77.71
10Command77.69
11Qwen 2 72B Instruct77.58
12Yi 34B (Base)77.51
13Qwen 1.5 14B77.21
14text-davinci-00376.98
15DeepSeek V376.53

Interactive version: theaggregate.ai/benchmark?slug=helm-naturalquestions-open · How It Works · Data refreshed daily, snapshot 2026-09-05.