SeaLLMs-v3-7B-Chat: benchmark results

Alibaba DAMO Academy's Southeast Asian chat model built on Qwen2-7B, covering 12 regional languages from Indonesian to Burmese (July 2024). Provider: Sea AI Lab. Released 2024-07-03. Access: Open.

Unified ELO 1489 ± 1, rank #739 of 1392 rated models, from 199 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task81.06Accuracy (%)89.5
SeaEval - Cultural Reasoning - SG-Eval v2 Open (Zero-Shot)55Accuracy (%)89.1
Open Arabic LLM - Alghafa Multiple Choice Sentiment Task42.44Accuracy (%)88.6
SeaEval - Multilingual Reasoning - C-Eval (Zero-Shot)76.59Accuracy (%)82.6
Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGE1)29.97ROUGE180.6
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task54.5Accuracy (%)79.9
SeaEval - Cultural Reasoning - CN-Eval (Zero-Shot)81.9Accuracy (%)79.2
Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGEL)20.27ROUGEL79.1
Open Korean LLM Leaderboard41.02Average Score (%)77.8
SeaEval - Cultural Reasoning - SG-Eval (Zero-Shot)71.84Accuracy (%)76.2
SeaEval - Multilingual Reasoning - CMMLU (Zero-Shot)76.84Accuracy (%)76.2
SeaEval - Dialogue - SAMSum (Zero-Shot)29.6Average ROUGE (0-100)75

Interactive version: theaggregate.ai/model?slug=seallms-v3-7b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.