Sailor-4B-Chat: benchmark results

Provider: Sea AI Lab. Access: Open.

Unified ELO 1341 ± 19, rank #2526 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K9.1Accuracy (%) (5-shot)29.6
Open LLM Leaderboard v1 - MMLU43.96Accuracy (%) (5-shot)23.1
Open LLM Leaderboard v1 - ARC Challenge45.05Normalized accuracy (%) (25-shot)20.6
Open LLM Leaderboard v1 - WinoGrande66.22Accuracy (%) (5-shot)19.9
Open LLM Leaderboard v1 - HellaSwag68.36Normalized accuracy (%) (10-shot)19.3
Open LLM Leaderboard v1 - TruthfulQA MC242.09MC2 (%) (0-shot)19.3
SEA LLM Leaderboard - SeaExam - Thai (Private)34Private Accuracy (%)15.6
SEA LLM Leaderboard - SeaExam - Thai (Public)36Public Accuracy (%)15.6
SEA LLM Leaderboard - SeaExam (Public)40.1Public Average Score (%)14.4
SEA LLM Leaderboard - SeaExam - Vietnamese (Public)45.3Public Accuracy (%)14.4
SEA LLM Leaderboard - SeaExam40.2Private Average Score (%)13.3
SEA LLM Leaderboard - SeaExam - Indonesian (Private)41.2Private Accuracy (%)13.3

Interactive version: theaggregate.ai/model?slug=sailor-4b-chat · How It Works · Data refreshed daily, snapshot 2026-09-23.