SEA-HELM (Indonesian) - SEA-MT-Bench (LLM Judge): leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Qwen 3.6 27B85.92
2Qwen 3.5 122B A10B85.61
3Gemma 4 31B (IT)85.12
4Qwen 3.5 27B84.81
5Qwen 3.5 35B A3B84.52
6Gemma 4 26B A4B (IT)84.49
7Qwen 3.6 35B A3B84.44
8Mistral Medium 3.582.55
9Gemma 4 12B (IT)81.97
10Qwen 3 VL 32B Instruct81.36
11Qwen 3 VL 8B Instruct79.59
12Qwen 3.5 9B78.75
13gemma-4-E4B-it77.4
14Gemma 3 27B (IT)77.1
15Mistral Small 476.5

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-indonesian-sea-mt-bench-llm-judge · How It Works · Data refreshed daily, snapshot 2026-09-19.