Llama 3 8B Cpt Sea Lionv2 Base: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1410 ± 21, rank #1121 of 1605 rated models, from 42 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SeaEval - Cultural Reasoning - PH-Eval (Few-Shot)54Accuracy (%)66.7
SeaEval - Emotion - IndoEmotion (Few-Shot)57.27Accuracy (%)66.7
SeaEval - Multilingual Reasoning - IndoMMLU (Few-Shot)50.42Accuracy (%)66.7
SeaEval - Cultural Reasoning - SG-Eval v1 Cleaned (Few-Shot)64.71Accuracy (%)50
SeaEval - Fundamental NLP Tasks - C3 (Few-Shot)79.96Accuracy (%)50
Sahabat-AI - Indonesian Average38.5Average Score (%)43.8
Sahabat-AI - Javanese (JV)38.94Score (%)43.8
Sahabat-AI - Sundanese (SU)34.11Score (%)43.8
SEA LLM Leaderboard - SeaExam - Thai (Private)43.4Private Accuracy (%)40
SEA LLM Leaderboard - SeaExam - Thai (Public)51.6Public Accuracy (%)40
SEA LLM Leaderboard - SeaExam - Indonesian (Public)49.2Public Accuracy (%)37.2
SEA LLM Leaderboard - SeaExam52.2Private Average Score (%)36.7

Interactive version: theaggregate.ai/model?slug=llama-3-8b-cpt-sea-lionv2-base · How It Works · Data refreshed daily, snapshot 2026-09-26.