Llama-3-SauerkrautLM-8B-Instruct — benchmark results
VAGO Solutions' German-English fine-tune of Llama 3 8B Instruct, two-stage DPO-trained on curated German data with Hyperspace.ai. Provider: Meta. Released 2024-05-01. Access: Open.
Unified ELO 1444 ± 16, rank #1030 of 1776 rated models, from 25 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Medical LLM - PubMedQA | 78.4 | Accuracy (%) | 97.4 |
| Open Korean LLM Leaderboard | 532.63 | Average Score (%) | 90.4 |
| Open LLM Leaderboard - IFEval | 74.45 | Score | 89.5 |
| Open Medical LLM - MMLU Medical Genetics | 83 | Accuracy (%) | 85.8 |
| Open Medical LLM - MMLU College Biology | 79.17 | Accuracy (%) | 80.7 |
| Open Chinese LLM - TruthfulQA MC | 59.01 | Accuracy (%) | 80.1 |
| Open Medical LLM - MedQA (USMLE) | 60.57 | Accuracy (%) | 75.6 |
| Open Medical LLM | 69.76 | Average Accuracy (%) | 71 |
| Open Medical LLM - MedMCQA | 56.73 | Accuracy (%) | 71 |
| Open LLM Leaderboard - MMLU-Pro | 31.75 | Score | 68.5 |
| Open Chinese LLM - ARC Challenge | 55.12 | Accuracy (%) | 67.7 |
| Open Chinese LLM Leaderboard | 58.68 | Average Score (%) | 66.5 |
Interactive version: theaggregate.ai/model?slug=llama-3-sauerkrautlm-8b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.