ThaiSafetyBench - Human-Chatbot Interaction Harms: leaderboard

Metric: Attack Success Rate (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1GPT-55.98
2openthaigpt1.5-72B-instruct12.82
3llama3.1-typhoon2-70B-instruct12.82
4Llama 3.3 70B Instruct13.25
5Qwen 2.5 72B Instruct14.53
6openthaigpt1.5-7B-instruct14.53
7SeaLLMs-v3-7B-Chat15.38
8Qwen 2.5 7B Instruct16.24
9GPT-4o16.67
10Llama 3.1 70B Instruct17.09
11Claude Sonnet 4.517.09
12Llama 3.2 3B Instruct20.51
13Llama 3.1 8B Instruct21.79
14llama3.1-typhoon2-8B-instruct23.93
15Gemma 3 12B (IT)24.79

Interactive version: theaggregate.ai/benchmark?slug=thaisafetybench-human-chatbot-interaction-harms · How It Works · Data refreshed daily, snapshot 2026-09-19.