HELM NaturalQuestions (Open) — leaderboard

Open-book question answering from Google search queries with access to Wikipedia passages, scored by F1. Part of Stanford HELM.

Metric: F1 (%). Source: crfm.stanford.edu. Status: saturation imminent. 91 models tracked.

Top models

#ModelScore
1Nova Pro82.9
2Nova Lite81.52
3PaLM-2 (Bison)81.26
4GPT-4o (2024-05-13)80.32
5GPT-4 Turbo79.52
6GPT-4o (2024-08-06)79.26
7GPT-4 (0613)78.97
8Nova Micro77.86
9Qwen 1.5 32B77.71
10Qwen 2 72B Instruct77.58
11Yi 34B (Base)77.51
12Qwen 1.5 14B77.21
13DeepSeek V376.53
14GPT-4 Turbo (Preview)76.29
15Qwen 1.5 72B75.85

Interactive version: theaggregate.ai/benchmark?slug=helm-naturalquestions-open · How the rankings work · Data refreshed daily, snapshot 2026-07-22.