Llama 3 8B Chinese Chat: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1483 ± 16, rank #1430 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU66.97Accuracy (%) (5-shot)88.6
Open LLM Leaderboard v1 - GSM8K67.17Accuracy (%) (5-shot)83.2
Open Chinese LLM - GSM8K51.78Accuracy (%)70.8
Open Chinese LLM - C-Eval Semantic72.07Accuracy (%)58.5
Open Chinese LLM Leaderboard56.89Average Score (%)56.1
Open LLM Leaderboard v1 - ARC Challenge61.77Normalized accuracy (%) (25-shot)54.4
Open Chinese LLM - CMMLU54.1Accuracy (%)53.1
Open LLM Leaderboard v1 - TruthfulQA MC251.41MC2 (%) (0-shot)51.9
Open Chinese LLM - WinoGrande62.67Accuracy (%)47
Open LLM Leaderboard v1 - WinoGrande75.22Accuracy (%) (5-shot)41
Open LLM Leaderboard v1 - HellaSwag80.07Normalized accuracy (%) (10-shot)40
Open Chinese LLM - ARC Challenge48.55Accuracy (%)35

Interactive version: theaggregate.ai/model?slug=llama-3-8b-chinese-chat · How It Works · Data refreshed daily, snapshot 2026-09-23.