Llama-3-Refueled — benchmark results

Provider: Meta. Released 2024-05-03. Access: Open.

Unified ELO 1388 ± 16, rank #1277 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH41.72Score80.9
Open LLM Leaderboard - MuSR14.64Score79.6
Open Chinese LLM - C-Eval Semantic71.28Accuracy (%)56.1
Open LLM Leaderboard - GPQA6.6Score55.6
Open LLM Leaderboard - IFEval46.2Score52.2
Open LLM Leaderboard - MMLU-Pro23.28Score39.8
Open Chinese LLM - CMMLU51.67Accuracy (%)39.2
Open LLM Leaderboard - MATH Level 56.65Score36
Open Chinese LLM - GSM8K37.45Accuracy (%)34.7
Open Chinese LLM Leaderboard51.26Average Score (%)22.6
Open Chinese LLM - WinoGrande60.62Accuracy (%)18.5
Open Chinese LLM - HellaSwag51.62Accuracy (%)9.8

Interactive version: theaggregate.ai/model?slug=llama-3-refueled · How the rankings work · Data refreshed daily, snapshot 2026-07-22.