Llama3-Chinese-8B-Instruct: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1455 ± 16, rank #1680 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K55.8Accuracy (%) (5-shot)67.5
Open LLM Leaderboard v1 - MMLU62.47Accuracy (%) (5-shot)55.4
Open LLM Leaderboard v1 - TruthfulQA MC251.5MC2 (%) (0-shot)52.2
Open Chinese LLM - C-Eval Semantic67.73Accuracy (%)43.9
Open LLM Leaderboard v1 - ARC Challenge59.04Normalized accuracy (%) (25-shot)41.9
Open Chinese LLM - CMMLU50.8Accuracy (%)37.1
Open Chinese LLM - WinoGrande61.96Accuracy (%)34.4
Open LLM Leaderboard v1 - WinoGrande73.95Accuracy (%) (5-shot)34.2
Open Chinese LLM - TruthfulQA MC52.11Accuracy (%)33.8
Open LLM Leaderboard v1 - HellaSwag78.23Normalized accuracy (%) (10-shot)33.3
Open Chinese LLM - GSM8K36.09Accuracy (%)32
Open Chinese LLM Leaderboard52.56Average Score (%)26.7

Interactive version: theaggregate.ai/model?slug=llama3-chinese-8b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-23.