SEA LLM Leaderboard - SeaBench - Thai (Private): leaderboard

Metric: Private Judge Score (1-10). Source: huggingface.co. 41 models tracked.

Top models

#ModelScore
1GPT-4.18.89
2DeepSeek V3 (0324)8.69
3Claude 3.7 Sonnet (20250219)8.67
4Gemini 2.0 Flash8.55
5GPT-4o (2024-08-06)8.53
6Claude 3.5 Sonnet (20241022)8.52
7Gemini 1.5 Pro8.52
8GPT-4.1 Mini8.48
9Gemma 3 27B (IT)8.36
10Gemini 2.0 Flash Lite8.15
11GPT-4o Mini (2024-07-18)8.02
12Gemma 3 12B (IT)7.96
13Gemini 1.5 Flash7.87
14Sailor2-20B-Chat7.72
15Qwen 2.5 72B Instruct7.65

Interactive version: theaggregate.ai/benchmark?slug=sea-llm-leaderboard-seabench-thai-private · How It Works · Data refreshed daily, snapshot 2026-09-19.