SEA-HELM (Indonesian) - Natural Language Inference: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)82.39
2Qwen 3.5 122B A10B81.75
3Qwen 3 VL 32B Instruct81.25
4Qwen 3.6 27B81.16
5Qwen 3.5 27B80.45
6Gemma 4 26B A4B (IT)79.26
7Llama 3.3 70B Instruct78.08
8Gemma 4 12B (IT)77.97
9Qwen 3.6 35B A3B75.54
10Gemma 3 12B (IT)74.91
11Gemma 3 27B (IT)73.26
12gemma-4-E4B-it73.26
13Qwen 3.5 35B A3B73.1
14Qwen 3 VL 8B Instruct71.68
15Qwen 3 VL 4B Instruct70.77

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-indonesian-natural-language-inference · How It Works · Data refreshed daily, snapshot 2026-09-19.