SEA LLM Leaderboard - SeaBench - Thai (Public): leaderboard

Metric: Public Judge Score (1-10). Source: huggingface.co. 41 models tracked.

Top models

#ModelScore
1GPT-4.18.93
2Claude 3.5 Sonnet (20241022)8.82
3Claude 3.7 Sonnet (20250219)8.78
4DeepSeek V3 (0324)8.7
5GPT-4o (2024-08-06)8.68
6Gemini 1.5 Pro8.68
7Gemini 2.0 Flash8.53
8Gemini 2.0 Flash Lite8.41
9GPT-4.1 Mini8.38
10Gemini 1.5 Flash8.25
11GPT-4o Mini (2024-07-18)8.22
12Gemma 3 27B (IT)8.2
13Claude 3.5 Haiku (20241022)8.01
14Gemma 3 12B (IT)7.86
15Sailor2-20B-Chat7.84

Interactive version: theaggregate.ai/benchmark?slug=sea-llm-leaderboard-seabench-thai-public · How It Works · Data refreshed daily, snapshot 2026-09-19.