SEA-HELM (Indonesian) - Linguistic Diagnostics: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)74.36
2Qwen 3.5 122B A10B62.25
3Qwen 3 VL 32B Instruct60.4
4Qwen 3.5 27B60.22
5Gemma 4 26B A4B (IT)60.21
6Gemma 4 12B (IT)57.65
7Gemma 3 27B (IT)55.61
8Llama 3.3 70B Instruct55.52
9Qwen 3.6 27B55.22
10Llama 4 Scout Instruct54.77
11Qwen 3.6 35B A3B54.04
12Qwen 3.5 35B A3B51.22
13Mistral Medium 3.550.06
14Gemma 3 12B (IT)48.05
15gemma-4-E4B-it47.85

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-indonesian-linguistic-diagnostics · How It Works · Data refreshed daily, snapshot 2026-09-19.