HELM ThaiExam - TGAT — leaderboard

Metric: EM. Source: crfm.stanford.edu. 42 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20240620)83.08
2Claude 3 Opus (20240229)80
3GPT-4o (2024-05-13)75.38
4GPT-4o Mini (2024-07-18)73.85
5Llama 3.1 405B Instruct73.85
6Claude 3 Sonnet (20240229)73.85
7Gemini 1.5 Pro (001)73.85
8Qwen 2 72B Instruct70.77
9GPT-4 Turbo70.77
10Claude 3 Haiku (20240307)70.77
11Llama 3 70B Instruct69.23
12Gemini 1.0 Pro (002)69.23
13Qwen1.5 Chat (72B)69.23
14Llama 3.1 70B Instruct67.69
15Gemini 1.5 Flash (001)67.69

Interactive version: theaggregate.ai/benchmark?slug=helm-thaiexam-tgat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.