Llama-3-SauerkrautLM-8B-Instruct — benchmark results

VAGO Solutions' German-English fine-tune of Llama 3 8B Instruct, two-stage DPO-trained on curated German data with Hyperspace.ai. Provider: Meta. Released 2024-05-01. Access: Open.

Unified ELO 1444 ± 16, rank #1030 of 1776 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Medical LLM - PubMedQA78.4Accuracy (%)97.4
Open Korean LLM Leaderboard532.63Average Score (%)90.4
Open LLM Leaderboard - IFEval74.45Score89.5
Open Medical LLM - MMLU Medical Genetics83Accuracy (%)85.8
Open Medical LLM - MMLU College Biology79.17Accuracy (%)80.7
Open Chinese LLM - TruthfulQA MC59.01Accuracy (%)80.1
Open Medical LLM - MedQA (USMLE)60.57Accuracy (%)75.6
Open Medical LLM69.76Average Accuracy (%)71
Open Medical LLM - MedMCQA56.73Accuracy (%)71
Open LLM Leaderboard - MMLU-Pro31.75Score68.5
Open Chinese LLM - ARC Challenge55.12Accuracy (%)67.7
Open Chinese LLM Leaderboard58.68Average Score (%)66.5

Interactive version: theaggregate.ai/model?slug=llama-3-sauerkrautlm-8b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.