LLaMA3-iterative-DPO-final: benchmark results

Provider: Meta. Released 2024-05-17. Access: Open.

Unified ELO 1405 ± 1, rank #1116 of 1392 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard46.05Average Score (%)92.5
Open LLM Leaderboard - IFEval53.4Score63.7
Open LLM Leaderboard - BBH29.79Score50.9
RewardBench67.83Score (%)50.5
Open LLM Leaderboard - MMLU-Pro25.08Score44.9
RewardBench Chat Hard59.21Accuracy (%)44.3
Open LLM Leaderboard - MATH Level 58.84Score43.6
RewardBench Safety78.65Accuracy (%)41.5
Open LLM Leaderboard - GPQA4.47Score38.5
Open LLM Leaderboard - MuSR5.08Score24.9
RewardBench Chat83.8Accuracy (%)17.6
RewardBench Reasoning61.61Accuracy (%)17.2

Interactive version: theaggregate.ai/model?slug=llama3-iterative-dpo-final · How It Works · Data refreshed daily, snapshot 2026-09-05.