llama-3-chinese-8B-instruct-v3: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1479 ± 16, rank #1467 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU67.9Accuracy (%) (5-shot)90.1
Open LLM Leaderboard v1 - GSM8K59.21Accuracy (%) (5-shot)71
Open Chinese LLM - C-Eval Semantic74.19Accuracy (%)63.1
Open LLM Leaderboard v1 - ARC Challenge63.4Normalized accuracy (%) (25-shot)62.6
Open LLM Leaderboard v1 - TruthfulQA MC253.57MC2 (%) (0-shot)60.1
Open Chinese LLM - CMMLU54.39Accuracy (%)57
Open LLM Leaderboard v1 - WinoGrande76.24Accuracy (%) (5-shot)47
Open LLM Leaderboard v1 - HellaSwag80.51Normalized accuracy (%) (10-shot)41.2
Open Chinese LLM - ARC Challenge49.32Accuracy (%)38.6
Open Chinese LLM - GSM8K38.67Accuracy (%)36.4
Open Chinese LLM - WinoGrande62.04Accuracy (%)35.8
Open Chinese LLM Leaderboard54.69Average Score (%)34.6

Interactive version: theaggregate.ai/model?slug=llama-3-chinese-8b-instruct-v3 · How It Works · Data refreshed daily, snapshot 2026-09-23.