Llama 3.1 8B MultiReflection Instruct — benchmark results

leafspark's LoRA fine-tune of Llama 3.1 8B Instruct on synthetic reflection data to mimic o1-style structured multi-step reasoning. Provider: Meta. Released 2024-09-15. Access: Open.

Unified ELO 1474 ± 31, rank #893 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard516.2Average Score (%)89
Open LLM Leaderboard - IFEval71.25Score84.6
Open LLM Leaderboard - MATH Level 517.07Score65.6
Open LLM Leaderboard - MMLU-Pro30.27Score61.3
Open LLM Leaderboard - GPQA5.7Score47.8
Open LLM Leaderboard - BBH28.45Score46.6
Open LLM Leaderboard - MuSR8.52Score40.8

Interactive version: theaggregate.ai/model?slug=llama-3-1-8b-multireflection-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.