Llama-3-Instruct-8B-SimPO-v0.2 — benchmark results
Princeton NLP's SimPO v0.2 fine-tune of Llama 3 8B Instruct, the updated release from the SimPO reference-free preference optimization paper. Provider: Meta. Released 2024-07-06. Access: Open.
Unified ELO 1420 ± 41, rank #1133 of 1776 rated models, from 8 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 68.09 | Score | 80.8 |
| Open LLM Leaderboard - GPQA | 8.61 | Score | 71.4 |
| Open LLM Leaderboard - MMLU-Pro | 29.84 | Score | 59.3 |
| Open Korean LLM Leaderboard | 165.69 | Average Score (%) | 56.6 |
| Open LLM Leaderboard - BBH | 29.21 | Score | 49 |
| WildBench | 37.16 | WB Score Task-Macro | 46.8 |
| Open LLM Leaderboard - MuSR | 8.39 | Score | 40.1 |
| Open LLM Leaderboard - MATH Level 5 | 7.4 | Score | 38.9 |
Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-simpo-v0-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.