llama-3-merged-linear: benchmark results

Provider: Meta. Released 2024-05-01. Access: Open.

Unified ELO 1517 ± 13, rank #994 of 2656 rated models, from 34 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Medical LLM - PubMedQA78.2Accuracy (%)96.3
Open Korean LLM - KorNAT-Helpful52.65Normalized accuracy (%)93.6
Open Korean LLM - Ko-EQ-Bench39.85EQ-Bench score91.2
Open Medical LLM - MMLU College Biology81.25Accuracy (%)90.9
Open Korean LLM Leaderboard44.27Average Score (%)90.1
Open Ko-LLM Leaderboard44.27Average (%)90
Open Korean LLM - Ko-GPQA-Diamond26.77Normalized accuracy (%)88.9
Open Medical LLM - MMLU Medical Genetics83Accuracy (%)85.8
Open Korean LLM - Ko-IFEval41.62Strict accuracy, prompt/instruction mean (%)85
Open Korean LLM - Ko-GSM8K (flexible extract)47.61Exact match, flexible extract (%)81.5
Open Korean LLM - KorNAT-Harmless65.56Normalized accuracy (%)81.3
Open Portuguese LLM - OAB Exams51.48Accuracy (%)80.3

Interactive version: theaggregate.ai/model?slug=llama-3-merged-linear · How It Works · Data refreshed daily, snapshot 2026-09-19.