SauerkrautLM-Phi-3 (Medium) — benchmark results

VAGOsolutions' German-English DPO tune of Microsoft's Phi-3-medium-4k-instruct (14B), fine-tuned with Spectrum QLoRA on 50% of layers (June 2024). Provider: VAGOsolutions. Released 2024-06-09. Access: Open.

Unified ELO 1478 ± 20, rank #883 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR20.7Score95.9
Open LLM Leaderboard - BBH49.63Score90.8
Open Chinese LLM - GSM8K65.05Accuracy (%)89.6
Open Korean LLM Leaderboard502.01Average Score (%)87.6
Open Chinese LLM - ARC Challenge59.64Accuracy (%)85.6
Open LLM Leaderboard - MMLU-Pro40.72Score85.6
Open LLM Leaderboard - GPQA11.3Score82.3
Open Chinese LLM Leaderboard65.3Average Score (%)80.9
Open Chinese LLM - WinoGrande66.54Accuracy (%)78.9
Open Chinese LLM - CMMLU64.72Accuracy (%)76.9
Open Chinese LLM - C-Eval Semantic81.91Accuracy (%)71.2
Open Chinese LLM - HellaSwag62.96Accuracy (%)71.2

Interactive version: theaggregate.ai/model?slug=sauerkrautlm-phi-3-medium · How the rankings work · Data refreshed daily, snapshot 2026-07-22.