Llama3-TenyxChat-70B — benchmark results
Tenyx's DPO fine-tune of Llama 3 70B Instruct trained on UltraFeedback to improve chat quality while limiting catastrophic forgetting. Provider: Meta. Released 2024-04-26. Access: Open.
Unified ELO 1502 ± 29, rank #792 of 1776 rated models, from 14 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - GSM8K | 72.71 | Accuracy (%) | 99.1 |
| Open LLM Leaderboard - IFEval | 80.87 | Score | 98.3 |
| Open Chinese LLM - CMMLU | 72.02 | Accuracy (%) | 94.1 |
| Open LLM Leaderboard - BBH | 49.62 | Score | 90.8 |
| Open LLM Leaderboard - MMLU-Pro | 46.78 | Score | 90.5 |
| Open Chinese LLM - ARC Challenge | 60.24 | Accuracy (%) | 87.7 |
| Open Chinese LLM Leaderboard | 67.18 | Average Score (%) | 87.2 |
| Open Chinese LLM - C-Eval Semantic | 86.83 | Accuracy (%) | 82.5 |
| Open LLM Leaderboard - MATH Level 5 | 23.56 | Score | 77 |
| Open Chinese LLM - HellaSwag | 63.96 | Accuracy (%) | 74.8 |
| Open LLM Leaderboard - MuSR | 12.52 | Score | 68.5 |
| Open LLM Leaderboard - GPQA | 6.82 | Score | 57.4 |
Interactive version: theaggregate.ai/model?slug=llama3-tenyxchat-70b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.