Higgs-Llama-3-70B: benchmark results

Boson AI's role-play-focused tune of Llama 3 70B, combining SFT with iterative preference optimization for character and system-prompt adherence. Provider: Boson AI. Released 2024-06-05. Access: Open.

Unified ELO 1609 ± 1, rank #238 of 1392 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - CMMLU75.33Accuracy (%)99.1
Open Chinese LLM - GSM8K71.65Accuracy (%)98.8
Open Chinese LLM Leaderboard70Average Score (%)96.7
Open LLM Leaderboard - GPQA15.55Score91.9
Open Chinese LLM - ARC Challenge61.26Accuracy (%)90.5
Open Chinese LLM - C-Eval Semantic88.16Accuracy (%)87.4
Open LLM Leaderboard - MMLU-Pro43.35Score87.1
Open Chinese LLM - HellaSwag68.31Accuracy (%)86.9
Open LLM Leaderboard - BBH45.9Score86
Open LLM Leaderboard - MuSR15.52Score83.2
Open Chinese LLM - WinoGrande67.4Accuracy (%)82.5
Open LLM Leaderboard - MATH Level 525.23Score78.2

Interactive version: theaggregate.ai/model?slug=higgs-llama-3-70b · How It Works · Data refreshed daily, snapshot 2026-09-05.