llama-3-chinese-8B-instruct: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1461 ± 16, rank #1626 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - TruthfulQA MC255.15MC2 (%) (0-shot)64.3
Open Chinese LLM - WinoGrande63.69Accuracy (%)59.9
Open LLM Leaderboard v1 - GSM8K44.43Accuracy (%) (5-shot)58.5
Open LLM Leaderboard v1 - MMLU63.1Accuracy (%) (5-shot)58.4
Open LLM Leaderboard v1 - ARC Challenge61.26Normalized accuracy (%) (25-shot)52
Open Chinese LLM - C-Eval Semantic69.49Accuracy (%)50.1
Open Chinese LLM - HellaSwag59.08Accuracy (%)42.9
Open LLM Leaderboard v1 - HellaSwag80.24Normalized accuracy (%) (10-shot)40.5
Open LLM Leaderboard v1 - WinoGrande75.06Accuracy (%) (5-shot)40.1
Open Chinese LLM - CMMLU51.39Accuracy (%)38.3
Open Chinese LLM - TruthfulQA MC52.52Accuracy (%)37.7
Open Chinese LLM Leaderboard53.98Average Score (%)32

Interactive version: theaggregate.ai/model?slug=llama-3-chinese-8b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-23.