llama-3-chinese-8B-instruct-v2: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1475 ± 16, rank #1510 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU66.48Accuracy (%) (5-shot)87.4
Open LLM Leaderboard v1 - GSM8K60.58Accuracy (%) (5-shot)72.8
Open LLM Leaderboard v1 - TruthfulQA MC253.93MC2 (%) (0-shot)61.2
Open LLM Leaderboard v1 - ARC Challenge62.63Normalized accuracy (%) (25-shot)59.1
Open LLM Leaderboard v1 - WinoGrande76.72Accuracy (%) (5-shot)50.2
Open Chinese LLM - C-Eval Semantic69.2Accuracy (%)49.3
Open Chinese LLM - GSM8K44.81Accuracy (%)46.1
Open Chinese LLM - CMMLU52.9Accuracy (%)45.1
Open LLM Leaderboard v1 - HellaSwag79.72Normalized accuracy (%) (10-shot)39
Open Chinese LLM Leaderboard54.96Average Score (%)36.8
Open Chinese LLM - HellaSwag57.66Accuracy (%)34.1
Open Chinese LLM - TruthfulQA MC52.02Accuracy (%)33.2

Interactive version: theaggregate.ai/model?slug=llama-3-chinese-8b-instruct-v2 · How It Works · Data refreshed daily, snapshot 2026-09-23.