HELM VHELM - Exams V - Chinese (Natural Science): leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1O4 Mini (2025-04-16)74.74
2O3 (2025-04-16)74.74
3O1 (2024-12-17)68.07
4Gemini 2.0 Flash (Preview)64.91
5Gemini 2.5 Pro (Preview 03-25)62.46
6Gemini 2.0 Flash61.75
7Gemini 2.0 Flash Lite58.95
8Gemini 2.0 Pro (Preview 02-05)55.79
9GPT-4 Turbo50.88
10GPT-4.1 (2025-04-14)48.77
11Gemini 1.5 Flash (002)47.37
12Claude 3.5 Sonnet (20240620)47.37
13Gemini 1.5 Pro (002)46.32
14Claude 3 Opus (20240229)45.61
15GPT-4.545.61

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-exams-v-chinese-natural-science · How It Works · Data refreshed daily, snapshot 2026-09-19.