Llama 3 8B Cpt Sea Lionv2 Instruct: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1451 ± 1, rank #939 of 1392 rated models, from 61 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SeaEval - Dialogue - SAMSum (Zero-Shot)30.7Average ROUGE (0-100)91.7
SeaEval - Dialogue - DialogSum (Zero-Shot)25.78Average ROUGE (0-100)91.3
Thai LLM - Knowledge III5.05Rating (0-10)88
Thai LLM NLG - flores200_tha_Thai_eng_Latn_seacrowd_t2t (BLEU)50.77BLEU86.6
Thai LLM NLG - flores200_eng_Latn_tha_Thai_seacrowd_t2t (BLEU)27.25BLEU80.6
Thai LLM NLG - flores200_eng_Latn_tha_Thai_seacrowd_t2t (SacreBLEU)37.8SacreBLEU80.6
Thai LLM NLG - flores200_tha_Thai_eng_Latn_seacrowd_t2t (SacreBLEU)34.14SacreBLEU80.6
Thai LLM NLG - flores200_eng_Latn_tha_Thai_seacrowd_t2t (chrF++)53.08chrF++79.1
SeaEval - Cultural Reasoning - SG-Eval v1 Cleaned (Zero-Shot)66.18Accuracy (%)73.8
Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGE1)54.04ROUGE171.6
Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGEL)53.61ROUGEL71.6
Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGE2)42.74ROUGE270.1

Interactive version: theaggregate.ai/model?slug=llama-3-8b-cpt-sea-lionv2-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.