Llama3-TenyxChat-70B — benchmark results

Tenyx's DPO fine-tune of Llama 3 70B Instruct trained on UltraFeedback to improve chat quality while limiting catastrophic forgetting. Provider: Meta. Released 2024-04-26. Access: Open.

Unified ELO 1502 ± 29, rank #792 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - GSM8K72.71Accuracy (%)99.1
Open LLM Leaderboard - IFEval80.87Score98.3
Open Chinese LLM - CMMLU72.02Accuracy (%)94.1
Open LLM Leaderboard - BBH49.62Score90.8
Open LLM Leaderboard - MMLU-Pro46.78Score90.5
Open Chinese LLM - ARC Challenge60.24Accuracy (%)87.7
Open Chinese LLM Leaderboard67.18Average Score (%)87.2
Open Chinese LLM - C-Eval Semantic86.83Accuracy (%)82.5
Open LLM Leaderboard - MATH Level 523.56Score77
Open Chinese LLM - HellaSwag63.96Accuracy (%)74.8
Open LLM Leaderboard - MuSR12.52Score68.5
Open LLM Leaderboard - GPQA6.82Score57.4

Interactive version: theaggregate.ai/model?slug=llama3-tenyxchat-70b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.