Llama 3 70B ShiningValiant2 — benchmark results

Valiant Labs' Shining Valiant 2 fine-tune of Llama 3 70B Instruct for science, engineering, and structured technical reasoning. Provider: Meta. Released 2024-04-20. Access: Open.

Unified ELO 1484 ± 18, rank #862 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - GSM8K62.62Accuracy (%)87.5
Open LLM Leaderboard - MMLU-Pro43.31Score87.1
Open LLM Leaderboard - BBH46.71Score86.5
Open Chinese LLM - CMMLU68.74Accuracy (%)81.3
Open Chinese LLM Leaderboard65.3Average Score (%)80.9
Open LLM Leaderboard - GPQA10.74Score80.7
Open Chinese LLM - C-Eval Semantic86.04Accuracy (%)78.3
Open Chinese LLM - ARC Challenge57.85Accuracy (%)77.3
Open LLM Leaderboard - MuSR13.64Score75
Open Chinese LLM - WinoGrande65.67Accuracy (%)74
Open LLM Leaderboard - IFEval61.22Score73.3
Open LLM Leaderboard - MATH Level 520.77Score72.2

Interactive version: theaggregate.ai/model?slug=llama-3-70b-shiningvaliant2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.