HELM VHELM - Exams V - Chinese (Social Sciences): leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)80
2O3 (2025-04-16)78.95
3O1 (2024-12-17)78.95
4O4 Mini (2025-04-16)74.21
5Gemini 2.0 Flash (Preview)67.89
6Gemini 2.0 Flash66.32
7Gemini 2.0 Pro (Preview 02-05)65.79
8Gemini 1.5 Flash (002)61.05
9Gemini 2.0 Flash Lite61.05
10Gemini 1.5 Pro (002)57.37
11GPT-4.1 (2025-04-14)57.37
12GPT-4.555.79
13Llama 4 Maverick Instruct FP853.68
14GPT-4o (2024-11-20)53.68
15GPT-4o (2024-05-13)53.16

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-exams-v-chinese-social-sciences · How It Works · Data refreshed daily, snapshot 2026-09-19.