Llama 3 70B Instruct DPO V0.2: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1576 ± 17, rank #750 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K88.25Accuracy (%) (5-shot)100
Open LLM Leaderboard v1 - MMLU80.41Accuracy (%) (5-shot)99.7
Open Chinese LLM - GSM8K71.42Accuracy (%)98.2
Open Chinese LLM - CMMLU72.29Accuracy (%)95.3
Open LLM Leaderboard v1 - ARC Challenge72.53Normalized accuracy (%) (25-shot)92.4
Open Chinese LLM - ARC Challenge60.41Accuracy (%)88.4
Open Chinese LLM Leaderboard66.97Average Score (%)86.4
Open LLM Leaderboard v1 - WinoGrande82.79Accuracy (%) (5-shot)85.6
Open Chinese LLM - C-Eval Semantic86.94Accuracy (%)82.8
Open LLM Leaderboard v1 - TruthfulQA MC263.57MC2 (%) (0-shot)80.9
Open LLM Leaderboard v1 - HellaSwag86.22Normalized accuracy (%) (10-shot)79.6
Open Chinese LLM - HellaSwag63.4Accuracy (%)73

Interactive version: theaggregate.ai/model?slug=llama-3-70b-instruct-dpo-v0-2 · How It Works · Data refreshed daily, snapshot 2026-09-23.