YamshadowExperiment28-7B — benchmark results

mlabonne's automerger SLERP of YamShadow-7B and yam-peleg's Experiment28-7B, briefly the top 7B on the Open LLM Leaderboard amid overfitting caveats. Provider: Other. Released 2024-03-18. Access: Open.

Unified ELO 1409 ± 14, rank #1180 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC63.65Accuracy (%)94.2
Open LLM Leaderboard - MuSR12.69Score69.5
Open Chinese LLM - ARC Challenge53.92Accuracy (%)60.5
Open Chinese LLM - HellaSwag60.95Accuracy (%)60.1
Open LLM Leaderboard - BBH31.98Score59.4
Open Chinese LLM - GSM8K46.17Accuracy (%)52.7
Open Chinese LLM Leaderboard56.6Average Score (%)49.3
Open Chinese LLM - WinoGrande62.75Accuracy (%)47.8
Open LLM Leaderboard - GPQA4.92Score41.7
Open LLM Leaderboard - IFEval40.7Score40.8
Open LLM Leaderboard - MMLU-Pro22.89Score38.5
Open LLM Leaderboard - MATH Level 56.12Score33.5

Interactive version: theaggregate.ai/model?slug=yamshadowexperiment28-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.