Llama 3 70B Fireplace — benchmark results
Valiant Labs' function-calling fine-tune of Llama 3 70B Instruct trained on the glaive-function-calling-v2 dataset. Provider: Meta. Released 2024-05-09. Access: Open.
Unified ELO 1476 ± 28, rank #886 of 1776 rated models, from 14 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 77.74 | Score | 93.8 |
| Open Chinese LLM - CMMLU | 71.6 | Accuracy (%) | 92 |
| Open LLM Leaderboard - BBH | 49.56 | Score | 90.7 |
| Open LLM Leaderboard - GPQA | 13.98 | Score | 89.4 |
| Open LLM Leaderboard - MMLU-Pro | 43.25 | Score | 87 |
| Open LLM Leaderboard - MuSR | 16.77 | Score | 86.8 |
| Open Chinese LLM - C-Eval Semantic | 85.71 | Accuracy (%) | 77.4 |
| Open LLM Leaderboard - MATH Level 5 | 21.45 | Score | 73.5 |
| Open Chinese LLM Leaderboard | 59.99 | Average Score (%) | 70.3 |
| Open Chinese LLM - ARC Challenge | 51.79 | Accuracy (%) | 47.3 |
| Open Chinese LLM - GSM8K | 39.95 | Accuracy (%) | 39.5 |
| Open Chinese LLM - TruthfulQA MC | 52.19 | Accuracy (%) | 35.3 |
Interactive version: theaggregate.ai/model?slug=llama-3-70b-fireplace · How the rankings work · Data refreshed daily, snapshot 2026-07-22.