HELM ThaiExam - A-Level — leaderboard

Metric: EM. Source: crfm.stanford.edu. 42 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20240620)66.93
2Llama 3.1 405B Instruct66.93
3Gemini 1.5 Pro (001)60.63
4Qwen 2 72B Instruct59.84
5GPT-4o (2024-05-13)59.84
6Claude 3 Opus (20240229)59.84
7Llama 3.1 70B Instruct55.12
8Gemini 1.5 Flash (001)53.54
9GPT-4 Turbo52.76
10Claude 3 Sonnet (20240229)48.82
11Llama 3 70B Instruct46.46
12GPT-4o Mini (2024-07-18)44.88
13Claude 3 Haiku (20240307)40.94
14Gemini 1.0 Pro (002)38.58
15Qwen1.5 Chat (72B)37.01

Interactive version: theaggregate.ai/benchmark?slug=helm-thaiexam-a-level · How the rankings work · Data refreshed daily, snapshot 2026-07-22.